Views
No views yet
| Tokenizer | Kurmancî | Soranî | Zazakî |
|---|---|---|---|
| kurdish-bpe-64k | 1.342 | 1.793 | 2.408 |
| kurdish-unigram-64k | 1.385 | 1.633 | 2.290 |
| kurdish-bpe-32k (this model) | 1.427 | 1.974 | 2.701 |
| kurdish-unigram-32k | 1.472 | 1.843 | 2.580 |
NLLB-200 (distilled-600M) | 1.930 | 2.336 | 2.548 |
XLM-RoBERTa (base) | 1.751 | 3.695 | 2.527 |
o200k_base (GPT-4o) | 2.361 | 3.984 | 2.732 |
cl100k_base (GPT-4) | 2.610 | 6.938 | 3.038 |
cl100k_base on every dialect (1.8× fewer tokens on Kurmancî, 3.5× fewer on
Soranî) despite being the weakest of the four Kurdish variants.1from transformers import AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained("kurdish-tech/kurdish-tokenizer-bpe-32k")
4
5tok("Ez kurd im, ji Kurdistanê me.") # Kurmancî
6tok("زمانی کوردی زمانێکی دەوڵەمەندە.") # Soranî
7tok("Ma kirmanc î, zon u kulturê ma.") # Zazakî| Vocabulary size | 32,000 |
| Algorithm | Byte-level BPE |
| Special tokens | <bos>, <eos>, <unk>, <pad>, <mask> |
model_max_length | 1024 |
1@misc{kurdishtech2026tokenizer,
2 title = {Kurdish Tokenizer (BPE 32k): a multi-dialect tokenizer for Kurmanc\^i, Soran\^i and Zazak\^i},
3 author = {{Kurdish-Tech}},
4 year = {2026},
5 url = {https://huggingface.co/kurdish-tech/kurdish-tokenizer-bpe-32k}
6}