Views
No views yet

1from transformers import pipeline
2classifier = pipeline('text-classification', model='knowhate/HateBERTimbau-yt-tt')
3
4classifier("as pessoas tem que perceber que ser 'panasca' não é deixar de ser homem, é deixar de ser humano 😂😂")
5
6[{'label': 'Hate Speech', 'score': 0.9959186911582947}]
71from transformers import AutoTokenizer, AutoModelForSequenceClassification, TrainingArguments, Trainer
2from datasets import load_dataset
3
4tokenizer = AutoTokenizer.from_pretrained("knowhate/HateBERTimbau-yt-tt")
5model = AutoModelForSequenceClassification.from_pretrained("knowhate/HateBERTimbau-yt-tt")
6dataset = load_dataset("knowhate/youtube-train")
7
8def tokenize_function(examples):
9 return tokenizer(examples["sentence1"], examples["sentence2"], padding="max_length", truncation=True)
10
11tokenized_datasets = dataset.map(tokenize_function, batched=True)
12
13training_args = TrainingArguments(output_dir="hatebertimbau", evaluation_strategy="epoch")
14trainer = Trainer(
15 model=model,
16 args=training_args,
17 train_dataset=tokenized_datasets["train"],
18 eval_dataset=tokenized_datasets["validation"],
19)
20
21trainer.train()
22| Dataset | Precision | Recall | F1-score |
|---|---|---|---|
| knowhate/youtube-test | 0.867 | 0.892 | 0.874 |
| knowhate/twitter-test | 0.397 | 0.627 | 0.486 |
1@article{
2
3}