Views
No views yet
google/gemma-3-1b-it for structured toxic speech analysis in English and Turkish.number_of_bad_wordstagsinsult_wordStrong InsultToxicSarcastic-MockingStrong Insult|ThreatMobbingMild InsultDiscriminatoryThreatPassive-AggressiveStrong Insult|Discriminatoryberkeruveyik/toxic-speech-annotated-datasetuser input + assistant structured target)1number_of_bad_words: 2
2tags: Strong Insult
3insult_word: stupid, uglySFTTrainer) on structured conversation data.max_length=512num_train_epochs=10per_device_train_batch_size=8per_device_eval_batch_size=8gradient_accumulation_steps=2learning_rate=2e-5lr_scheduler_type=cosinewarmup_ratio=0.1weight_decay=0.01save_strategy=epocheval_strategy=epochload_best_model_at_end=Truedo_sample=False).1from transformers import AutoTokenizer, AutoModelForCausalLM, pipeline
2
3MODEL_ID = "YOUR_USERNAME/YOUR_MODEL_REPO"
4
5tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
6model = AutoModelForCausalLM.from_pretrained(MODEL_ID, device_map="auto", dtype="auto")
7
8pipe = pipeline("text-generation", model=model, tokenizer=tokenizer)
9
10text = "You are useless and disgusting."
11messages = [{"role": "user", "content": text}]
12prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
13
14out = pipe(prompt, max_new_tokens=128, do_sample=False)
15print(out[0]["generated_text"][len(prompt):])number_of_bad_words MAEgoogle/gemma-3-1b-itberkeruveyik/toxic-speech-annotated-dataset