Views
No views yet
<unk> (0), <s> (1), </s> (2)LlamaTokenizer (compatible with AutoTokenizer)1from transformers import AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained("eljanmahammadli/aztext-tokenizer")
4ids = tok.encode("Salam, dünya! Azərbaycan dilində bir nümunə.")
5print(tok.convert_ids_to_tokens(ids))1@inproceedings{mahammadli2026aztext,
2 title={AzText: Curating Web-Scale Pretraining Data for a Low-Resource Language},
3 author={Mahammadli, Eljan and Rustamov, Samir},
4 booktitle={Artificial Intelligence for Digital Transformations (AIDT)},
5 year={2026}
6}