Views
No views yet
1from transformers import AutoTokenizer, AutoModelForMaskedLM, FillMaskPipeline
2# v1.0
3model_name = "lifeweb-ai/shiraz"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForMaskedLM.from_pretrained(model_name)
6
7text = "در همین لحظه که شما مشغول خواندن این متن هستید، میلیونها دیتا در فضای آنلاین در حال تولید است. ما در لایف وب به جمعآوری، پردازش و تحلیل این کلان داده (Big Data) میپردازیم."
8print(tokenizer.tokenize(text))
9
10# ['در', 'همین', 'لحظه', 'که', 'شما', 'مشغول', 'خواندن', 'این', 'متن', 'هستید،', 'میلیون', '[zwnj]', 'ها', 'دیتا', 'در', 'فضای', 'انلاین', 'در', 'حال', 'تولید', 'است', '.', 'ما', 'در', 'لایف', 'وب', 'به', 'جمع', '[zwnj]', 'اوری', '##،', 'پردازش', 'و', 'تحلیل', 'این', 'کلان', 'داده', '(', 'big', 'data', ')', 'می', '[zwnj]', 'پردازیم', '.', '.']
11
12# fill mask task
13text = "در همین لحظه که شما مشغول [MASK] این متن هستید، میلیونها دیتا در فضای آنلاین در حال تولید است. ما در لایف وب به جمعآوری، پردازش و تحلیل این کلان داده (Big Data) میپردازیم."
14
15classifier = FillMaskPipeline(model=model, tokenizer=tokenizer)
16result = classifier(text)
17print(result[0])
18#{'score': 0.3584367036819458, 'token': 5764, 'token_str': 'خواندن', 'sequence': 'در همین لحظه که شما مشغول خواندن این متن هستید، میلیون ها دیتا در فضای انلاین در حال تولید است. ما در لایف وب به جمع اوری، پردازش و تحلیل این کلان داده ( big data ) می پردازیم.'}| Model | NER | Sentiment | Emotion | ||
|---|---|---|---|---|---|
| Arman | Peyma | Sentipers (multi) | Snappfood | Arman | |
| lifeweb-ai/tehran | 71.87% | 90.79% | 63.75% | 88.74% | 77.73% |
| lifeweb-ai/shiraz | 67.62% | 86.24% | 59.17% | 88.01% | 66.97% |
| sbunlp/fabert | 71.23% | 88.53% | 58.51% | 88.60% | 72.65% |
| ViraIntelligentDataMining/AriaBERT | 69.12% | 87.15% | 59.26% | 87.96% | 69.11% |
| HooshvareLab/bert-fa-zwnj-base | 67.49% | 85.73% | 59.61% | 87.58% | 59.27% |
| HooshvareLab/roberta-fa-zwnj-base | 69.73% | 86.21% | 56.23% | 87.19% | 57.96% |
@misc{Shiraz,
author = {Mehrdad Azizi, Reza Salehi Chegeni, Parisa Mousavi, Iman Hashemi},
title = {[Optimizing Pre-trained BERT-based Models for Persian Language Processing]},
year = {2024},
publisher = {LifeWeb}
}