Views
No views yet
csebuetnlp/banglishbert (ELECTRA) for classifying Bangla/Banglish social media comments into 5 categories, with class-weighted loss to handle severe label imbalance.claim | general | opinion | spam-scam | toxic| Class | Precision | Recall | F1 | Support |
|---|---|---|---|---|
| claim | 0.52 | 0.56 | 0.54 | 27 |
| general | 0.97 | 0.95 | 0.96 | 3768 |
| opinion | 0.84 | 0.92 | 0.88 | 875 |
| spam-scam | 0.96 | 0.93 | 0.95 | 28 |
| toxic | 0.77 | 0.79 | 0.78 | 197 |
claim, spam-scam) have low support and should be treated with caution in production.1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("gulamsakaria/commentlens-banglishbert")
5model = AutoModelForSequenceClassification.from_pretrained("gulamsakaria/commentlens-banglishbert")
6
7text = "এই পেজে সবাই মিথ্যা কথা বলে"
8inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
9with torch.no_grad():
10 logits = model(**inputs).logits
11probs = torch.softmax(logits, dim=-1)
12pred = model.config.id2label[int(probs.argmax())]
13print(pred, float(probs.max()))