Views
No views yet
Exqrch/IndoDiscourse-ToxicityClassifier (BERT) yang dikonfigurasi ulang untuk Multi-class Classification guna mendeteksi 19 jenis kategori bahaya (harm) dalam bahasa Indonesia berdasarkan dataset IndoSafety.1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4model_name = "mSatashi/mentilinSafe-BERT-Multiclass"
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModelForSequenceClassification.from_pretrained(model_name)
7
8def predict(text):
9 inputs = tokenizer(text, return_tensors="pt", padding=True, truncation=True)
10 with torch.no_grad():
11 outputs = model(**inputs)
12 probs = torch.nn.functional.softmax(outputs.logits, dim=-1)
13 pred_id = torch.argmax(probs, dim=-1).item()
14 return model.config.id2label[pred_id], probs[0][pred_id].item()
15
16text = "Masukkan kalimat di sini"
17label, score = predict(text)
18print(f"Kategori: {label} ({score:.4f})")IndoSafety-Eval-1: