Views
No views yet
First systematic tokenization infrastructure for Kashmiri (ISO 639-3: kas) Five tokenizer architectures trained on the KS-LIT-3M 3.1M-word corpus.
| Folder | Architecture | Vocab | Best For |
|---|---|---|---|
kashmiri_char_tokenizer/ | Character-Level | ~120 | ASR, OCR, char-level LM |
kashmiri_word_tokenizer/ | Word-Level | ~120K | Lookup, bag-of-words |
kashmiri_wordpiece_tokenizer/ | WordPiece (BERT) | 32K | NER, POS, classification |
kashmiri_bpe_tokenizer/ | BPE (GPT) | 32K | Text generation, MT |
kashmiri_unigram_tokenizer/ | Unigram (SentencePiece) | 32K | Multilingual, NMT |
AutoTokenizer-compatible repositories. Each can be loaded in a single line and used immediately with the transformers library.pip install transformers torchpip install sentencepiece1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("Omarrran/Kashmiri_WordPiece_Tokenizer")
3
4text = "کٲشِر زَبان چھِیہٕ خٲص زَبان"
5encoding = tokenizer(text, return_tensors="pt")
6print(tokenizer.tokenize(text))
7print(encoding.input_ids)['کٲشِر', 'زَبان', 'چھِ', '##یہٕ', 'خٲص', 'زَبان']1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("Omarrran/Kashmiri_Unigram_Tokenizer")
3
4text = "کٲشِر زَبان چھِیہٕ خٲص زَبان"
5encoding = tokenizer(text, return_tensors="pt")
6print(tokenizer.tokenize(text))
7print(encoding.input_ids)['▁کٲشِر', '▁زَبان', '▁چھِیہٕ', '▁خٲص', '▁زَبان']1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("Omarrran/Kashmiri_BPE_Tokenizer")
3
4text = "کٲشِر زَبان چھِیہٕ خٲص زَبان"
5encoding = tokenizer(text, return_tensors="pt")
6print(tokenizer.tokenize(text))
7print(encoding.input_ids)['کٲشِر</w>', 'زَبان</w>', 'چھِ', 'یہٕ</w>', 'خٲ', 'ص</w>', 'زَبان</w>']1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("Omarrran/Kashmiri_Char_Tokenizer")
3
4text = "کٲشِر زَبان چھِیہٕ خٲص زَبان"
5encoding = tokenizer(text, return_tensors="pt")
6print(tokenizer.tokenize(text))
7print(encoding.input_ids)['ک', 'ٲ', 'ش', 'ِ', 'ر', ' ', 'ز', 'َ', 'ب', 'ا', 'ن', ...]1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("Omarrran/Kashmiri_Word_Tokenizer")
3
4text = "کٲشِر زَبان چھِیہٕ خٲص زَبان"
5encoding = tokenizer(text, return_tensors="pt")
6print(tokenizer.tokenize(text))
7print(encoding.input_ids)[UNK] tokens for out-of-vocabulary forms):['کٲشِر', 'زَبان', '[UNK]', '[UNK]', 'زَبان']1from transformers import AutoTokenizer
2
3tokenizers = {
4 "Character": AutoTokenizer.from_pretrained("Omarrran/Kashmiri_Char_Tokenizer"),
5 "Word": AutoTokenizer.from_pretrained("Omarrran/Kashmiri_Word_Tokenizer"),
6 "WordPiece": AutoTokenizer.from_pretrained("Omarrran/Kashmiri_WordPiece_Tokenizer"),
7 "BPE": AutoTokenizer.from_pretrained("Omarrran/Kashmiri_BPE_Tokenizer"),
8 "Unigram": AutoTokenizer.from_pretrained("Omarrran/Kashmiri_Unigram_Tokenizer"),
9}
10
11text = "کٲشِر زَبان چھِیہٕ خٲص زَبان"
12for name, tok in tokenizers.items():
13 print(f"{name:<10}: {tok.tokenize(text)}")| Tokenizer | Repository | Vocab | Best for |
|---|---|---|---|
| Character | Omarrran/Kashmiri_Char_Tokenizer | 133 | ASR/OCR, character-level models |
| Word | Omarrran/Kashmiri_Word_Tokenizer | 50,000 | Lookup baselines only |
| WordPiece | Omarrran/Kashmiri_WordPiece_Tokenizer | 16,000 | BERT-style encoders, NER |
| BPE | Omarrran/Kashmiri_BPE_Tokenizer | 16,000 | GPT-style generation, MT |
| Unigram | Omarrran/Kashmiri_Unigram_Tokenizer | 16,000 | Multilingual, morphology-aware |
1@article{malik2026kashtok,
2 title = {KashTok: Tokenizing Kashmiri at Scale with Novel
3 Diacritic- and Morphology-Aware Metrics},
4 author = {Malik, Haq Nawaz and Nissar, Nahfid and others},
5 year = {2026}
6}