Views
No views yet
xlm-roberta-base model for Named Entity Recognition (NER) in Kurmanji Kurdish. It was trained on a manually annotated dataset of 7,919 sentences covering news and other text sources. The model identifies the following entity types:xlm-roberta-base (270M parameters)| Metric | Value |
|---|---|
| Precision | 0.8668 |
| Recall | 0.8803 |
| F1 Score | 0.8735 |
1from transformers import AutoTokenizer, AutoModelForTokenClassification, pipeline
2
3model_id = "akam-ot/ku-ner-xlmr"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForTokenClassification.from_pretrained(model_id)
6
7ner = pipeline("ner", model=model, tokenizer=tokenizer, aggregation_strategy="simple")
8
9sentence = "Navê min Hejar e û ez li Hewlêr dijîm."
10results = ner(sentence)
11
12for ent in results:
13 print(f"{ent['word']} → {ent['entity_group']} (score: {ent['score']:.2f})")