Views
No views yet
Ammar-alhaj-ali/arabic-MARBERT-dialect-identification-city,
a MARBERT (UBC-NLP backbone) fine-tune for city-level Arabic dialect
identification - finer-grained than the country/region-level dialect
identifiers already common on the Hub.| File | Size | Purpose |
|---|---|---|
model.onnx | 622 MB | fp32 graph |
model.int8.onnx | 157 MB | dynamic int8 graph |
1import numpy as np
2import onnxruntime as ort
3from transformers import AutoTokenizer, AutoConfig
4from huggingface_hub import snapshot_download
5
6d = snapshot_download("TigreGotico/arabic-MARBERT-dialect-identification-city-onnx")
7tok = AutoTokenizer.from_pretrained(d)
8config = AutoConfig.from_pretrained(d)
9sess = ort.InferenceSession(f"{d}/model.onnx", providers=["CPUExecutionProvider"])
10
11def detect(text):
12 enc = tok(text, return_tensors="np", truncation=True)
13 inputs = {k: v for k, v in enc.items() if k in [i.name for i in sess.get_inputs()]}
14 logits = sess.run(None, inputs)[0]
15 idx = int(np.argmax(logits, axis=-1)[0])
16 return config.id2label[idx]
17
18print(detect("شلونك اليوم؟ شخبارك؟"))
19# -> Dohamodel.int8.onnx instead.transformers.pipeline("text-classification", model="...").1parity:
2 sample_size: 5
3 metric: top1_exact_match
4 fp32: 1.00 # 5/5
5 int8: 0.80 # 4/5| Model | Top-1 agreement with reference |
|---|---|
model.onnx (fp32) | 100.00% (5/5) |
model.int8.onnx | 80.00% (4/5) |
Aswan
and int8 predicts Cairo - both Egyptian cities, a fine-grained
within-country confusion rather than cross-dialect noise.