1from tokenizers import Tokenizer
2
3# Tokenizer'ı doğrudan yükleyin
4tokenizer = Tokenizer.from_file("turkish_tokenizer.json")
5
6# Encode işlemi
7text = "Yapay zeka Türkçe dilinde de çok güçlü."
8encoded = tokenizer.encode(text)
9
10print(encoded.tokens)
Modern LLM modelleri (Örn: Llama-3, DeepSeek) yüksek işlem hızı ve dile özgü kavrayış için büyük kelime dağarcıkları (100k - 128k) kullanır. Bu tokenizer da aynı vizyonla, Türkçe dilinin eklemeli yapısını daha iyi temsil edebilmesi için 128.000 tokenlik bir kapasiteyle eğitilmiştir.