Репозиторий содержит только токенизатор русского текста, данный токенизатор позволяет преобразовывать входные текстовые данные в последовательность токенов, каждый из которых представляет из себя морфемы из которых состоят слова.
В данный момент проект на ранней стадии разработки.
1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("evilfreelancer/morphemizer", trust_remote_code=True)
4test_text = "Философское восприятие мира."
5input_ids = tokenizer.encode(test_text)
6
7print("Text:", test_text)
8print("Encoded:", input_ids)
9print("Tokens:", tokenizer.convert_ids_to_tokens(input_ids))
10print("Decoded:", tokenizer.decode(input_ids))