1from transformers import PreTrainedTokenizerFast
2
3tokenizer = PreTrainedTokenizerFast.from_pretrained('chetanpun/devanagari-english-bpe-tokenizer')
1nepali_text = "मेरो नाम चेतन हो।"
2
3english_text = "My name is Chetan."
4
5mix_text = "Hello मेरो नाम चेतन हो।"
6
7nepali_tokens = tokenizer(nepali_text)
8english_tokens = tokenizer(english_text)
9
10print("Nepali Tokens:", nepali_tokens)
11print("English Tokens:", english_tokens)
1input_ids = tokenizer.encode(nepali_text, return_tensors="pt")
2
3decoded_text = tokenizer.decode(input_ids[0], skip_special_tokens=True)
4
5print("Decoded Text:", decoded_text)