Views
No views yet
1from transformers import AutoTokenizer
2
3# Load tokenizer from the Hub
4tokenizer = AutoTokenizer.from_pretrained("nazrinburz/azerbaijani-sentencepiece-tokenizer")
5
6# Example text in Azerbaijani
7text = "Azərbaycan dilinin inkişafı mədəniyyətimizin qorunması və gələcək nəsillərə ötürülməsi üçün vacib şərtdir."
8
9# Tokenize
10tokens = tokenizer.tokenize(text)
11print("Tokens:", tokens)
12
13# Encode into IDs
14ids = tokenizer.encode(text)
15print("Token IDs:", ids)
16
17# Decode back to text
18decoded = tokenizer.decode(ids)
19print("Decoded:", decoded)
20
21