Views
No views yet
base_tokenizer.json — joint LAS Unigram baselangspec_tur_Latn.json — language-specific overlay (re-EM on tur_Latn corpus)tokenizer.json — alias for the overlay (default load target)smoke.tur.yi-1_5-6b.v64000 (vocab=64000, langs=[tur_Latn], iters=5,
em_mode=soft, byte_fallback=True, seed-fix applied).1from tokenizers import Tokenizer
2tok = Tokenizer.from_file("tokenizer.json")