Views
No views yet
PreTrainedTokenizerFast object, wrapping a tokenizer from the tokenizers library.transformers library.1from transformers import PreTrainedTokenizerFast
2
3# Replace with your actual model ID
4REPO_ID = "your-hf-username/your-unigram-repo-name"
5tokenizer = PreTrainedTokenizerFast.from_pretrained(REPO_ID)
6
7# Example Usage
8english_text = "This is a test of the Unigram tokenizer."
9hindi_text = "यह यूनिग्राम टोकनाइज़र का एक परीक्षण है।"
10
11encoded_en = tokenizer(english_text)
12encoded_hi = tokenizer(hindi_text)
13
14print("Encoded English:", encoded_en['input_ids'])
15print("Decoded English:", tokenizer.decode(encoded_en['input_ids']))