Views
No views yet
1import sentencepiece as spm
2
3sp = spm.SentencePieceProcessor()
4sp.Load("hindi_unigram.model")
5
6tokens = sp.EncodeAsPieces("भारत एक महान देश है।")
7ids = sp.EncodeAsIds("भारत एक महान देश है।")
8print(sp.DecodeIds(ids))1from huggingface_hub import hf_hub_download
2import sentencepiece as spm
3
4model_path = hf_hub_download(
5 repo_id="adityaghai07/ag_hindi_uni_tokenizer_32k",
6 filename="hindi_unigram.model"
7)
8sp = spm.SentencePieceProcessor()
9sp.Load(model_path)