A Byte-Pair Encoding (BPE) tokenizer trained on a 330 MB ethically sourced corpus of standardized Albanian text. The vocabulary contains ~32,000 subword units. Special tokens [UNK], [CLS], [SEP], [PAD], [MASK] are included, making it suitable for transformer‑based models.
Një tokenizer Byte-Pair Encoding (BPE) i trajnuar mbi një korpus prej 330 MB të të dhënave të mbledhura etikisht me tekst të standardizuar shqip. Fjalori përmban rreth 32,000 njësi nënfjalësh. Tokenët specialë [UNK], [CLS], [SEP], [PAD], [MASK] janë të përfshirë, duke e bërë atë të përshtatshëm për modele të bazuara në transformer.
1from tokenizers import Tokenizer
2
3tokenizer = Tokenizer.from_file("tokenizer.json")
4encoded = tokenizer.encode("Përshëndetje, si jeni?")
5print(encoded.tokens) # list of tokens
6print(encoded.ids) # corresponding token IDs