1from tokenizers import Tokenizer
2
3# Загрузка токенизатора напрямую
4tokenizer = Tokenizer.from_file("vocab.json")
5
6# Или через transformers
7from transformers import AutoTokenizer
8
9tokenizer = AutoTokenizer.from_pretrained("bpe-tokenizer-ru-32000")
1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("bpe-tokenizer-ru-32000")
4
5text = "Пример текста для токенизации"
6tokens = tokenizer.tokenize(text)
7print(tokens)
8
9# Или для получения IDs
10input_ids = tokenizer.encode(text)
11print(input_ids)