Views
No views yet
base_tokenizer.json — joint LAS Unigram baselangspec_fin_Latn.json — language-specific overlay (re-EM on fin_Latn corpus)tokenizer.json — alias for the overlay (default load target)smoke.fin.gemma2-9b.v256000 (vocab=256000, langs=[fin_Latn], iters=5,
em_mode=soft, byte_fallback=True, seed-fix applied).1from tokenizers import Tokenizer
2tok = Tokenizer.from_file("tokenizer.json")