action=query&generator=random) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer.tokenizers kütüphanesi)[UNK], [PAD], [BOS], [EOS]grnnamespace=0, düz metin explaintext=1)1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer")
4ids = tokenizer("merhaba dünya")
5print(ids)Whitespace pre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önce ByteLevel veya Metaspace tipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir.