Views
No views yet
transformers package on ~30GB of Nepali LLM dataset (IRIISNEPAL/Nepali-Text-Corpus + nepberta-dataset).<id> <token>
0: <|endoftext|>
1: <|unk|>
50000: <|begin_of_text|>
50001: <|end_of_text|>
50002: <|start_header_id|>
50003: <|end_header_id|>
50004: <|eot_id|>
50005: '\n\n'transformers library. You can install it via pip:pip install transformers1from transformers import PreTrainedTokenizerFast
2
3# Load the tokenizer
4tokenizer = PreTrainedTokenizerFast.from_pretrained("Aananda-giri/NepaliBPE")
5
6# Example usage
7tokenizer.tokenize('राम ले भात खायो ।')
8# ['राम</w>', 'ले</w>', 'भात</w>', 'खायो</w>', '।</w>']
9
10tokenizer.encode('राम ले भात खायो ।')
11# [1621, 285, 14413, 27675, 251]
12
13tokenizer.decode([1621, 285, 14413, 27675, 251])
14# राम ले भात खायो ।