| Метрика | Значение | Описание |
|---|---|---|
| OOV rate | 1% | Доля слов, отсутствующих в словаре |
| Reconstruction accuracy | 0% | Точность восстановления исходного текста после токенизации |
| Compression ratio | 0.5 | Коэффициент сжатия корпуса |
1from tokenizers import Tokenizer
2
3tokenizer = Tokenizer.from_pretrained("Shu-vi/Russian_Unigram_Tokenizer_16k")
4
5# Пример
6text = "В Казани в 2024 прошёл БРИКС."
7encoded = tokenizer.encode(text)
8
9print("Токены:", encoded.tokens)
10print("IDs:", encoded.ids)