Views
No views yet
PersianBPETokenizer is a custom tokenizer specifically designed for the Persian (Farsi) language. It leverages the Byte-Pair Encoding (BPE) algorithm to create a robust vocabulary that can effectively handle the unique characteristics of Persian text. This tokenizer is optimized for use with advanced language models like BERT and RoBERTa, making it a valuable tool for various Persian NLP tasks.
Mohammad Shojaei. (2024). PersianBPETokenizer [Software]. Available at https://huggingface.co/mshojaei77/PersianBPETokenizer.mshojaei77/PersianTelegramChannels[UNK]).datasets, tokenizers, transformers).mshojaei77/PersianTelegramChannels dataset and created a batch iterator for efficient training.PreTrainedTokenizerFast object for compatibility with Hugging Face Transformers.[UNK], [CLS], [SEP], [PAD], [MASK]PersianBPETokenizer, first install the required libraries:pip install -q --upgrade datasets tokenizers transformers1from transformers import AutoTokenizer
2
3persian_tokenizer = AutoTokenizer.from_pretrained("mshojaei77/PersianBPETokenizer")1test_sentence = "سلام، چطور هستید؟ امیدوارم روز خوبی داشته باشید"
2tokens = persian_tokenizer.tokenize(test_sentence)
3print("Tokens:", tokens)
4encoded = persian_tokenizer(test_sentence)
5print("Input IDs:", encoded["input_ids"])
6print("Decoded:", persian_tokenizer.decode(encoded["input_ids"]))mshojaei77/PersianTelegramChannelsdatasets, tokenizers, and transformers