Views
No views yet
base_tokenizer.json — joint LAS Unigram baselangspec_fin_Latn.json — language-specific overlay (re-EM on fin_Latn corpus)tokenizer.json — alias for the overlay (default load target)smokeM4.fin.mistral-7b-v03.v32768 (vocab=32768, langs=[fin_Latn], iters=5,
em_mode=soft, byte_fallback=True, seed-fix applied).1from tokenizers import Tokenizer
2tok = Tokenizer.from_file("tokenizer.json")