Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2
3model = AutoModelForSequenceClassification.from_pretrained("oahmedd/MARBERTv2-Finetuned-on-QADI-dataset")
4tokenizer = AutoTokenizer.from_pretrained("oahmedd/MARBERTv2-Finetuned-on-QADI-dataset")1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2
3DIALECT_LABELS = [
4 "Omani", "Sudanese", "Saudi", "Kuwaiti", "Qatari", "Lebanese", "Jordanian",
5 "Syrian", "Iraqi", "Moroccan", "Egyptian", "Palestinian", "Yemeni", "Bahraini",
6 "Algerian", "Emirati", "Tunisian", "Libyan"
7]
8
9model = AutoModelForSequenceClassification.from_pretrained(
10 "oahmedd/MARBERTv2-Finetuned-on-QADI-dataset",
11 num_labels=18
12)
13tokenizer = AutoTokenizer.from_pretrained("oahmedd/MARBERTv2-Finetuned-on-QADI-dataset")
14
15model.eval()
16
17 text = "ازيك يصاحبي عامل ايه، ايه الاخبار"
18
19inputs = tokenizer(
20 text,
21 return_tensors="pt",
22 truncation=True,
23 padding=True,
24)
25
26with torch.inference_mode():
27 logits = model(**inputs).logits
28 prediction = torch.argmax(logits, dim=1).item()
29predicted_dialect = DIALECT_LABELS[prediction]
30
31print(f"Predicted Dialect: {predicted_dialect}")@article{essameldin2025arabic,
title={Arabic Dialect Classification using RNNs, Transformers, and Large Language Models: A Comparative Analysis},
author={Essameldin, Omar A and Elbeih, Ali O and Gomaa, Wael H and Elsersy, Wael F},
journal={arXiv preprint arXiv:2506.19753},
year={2025}
}