Views
No views yet
1from transformers import AutoTokenizer
2
3# Load the tokenizer from Hugging Face
4tokenizer = AutoTokenizer.from_pretrained("metinovadilet/kyrgyz_t5_tokenizer")
5
6# Example Kyrgyz sentence
7text = "Кыргызстандагы илимий долбоорлор өнүгүп жатат."
8
9# Tokenize the text
10tokens = tokenizer(text, return_tensors="pt")
11
12# Print token IDs
13print("Token IDs:", tokens["input_ids"][0].tolist())
14
15# Print individual tokenized words
16decoded_tokens = [tokenizer.decode([tid]) for tid in tokens["input_ids"][0].tolist()]
17print("Tokenized Words:", decoded_tokens)
18
19# Print segmentation
20print("\nWord Segmentation Breakdown:")
21for token_id in tokens["input_ids"][0].tolist():
22 token = tokenizer.decode([token_id])
23 print(f"'{token}' -> ID: {token_id}")
241@misc{metinovadilet2025kyrgyzT5tokenizer,
2 title={Kyrgyz T5 Tokenizer},
3 author={Metinov Adilet},
4 year={2025},
5 publisher={Hugging Face},
6 url=https://huggingface.co/metinovadilet/kyrgyz_t5_tokenizer
7}