Views
No views yet
1from transformers import pipeline, AutoTokenizer, AutoModelForMaskedLM
2
3tokenizer = AutoTokenizer.from_pretrained('tugstugi/bert-large-mongolian-cased', use_fast=False)
4model = AutoModelForMaskedLM.from_pretrained('tugstugi/bert-large-mongolian-cased')
5
6## declare task ##
7pipe = pipeline(task="fill-mask", model=model, tokenizer=tokenizer)
8
9## example ##
10input_ = 'Монгол улсын [MASK] Улаанбаатар хотоос ярьж байна.'
11
12output_ = pipe(input_)
13for i in range(len(output_)):
14 print(output_[i])
15
16## output ##
17# {'sequence': 'Монгол улсын нийслэл Улаанбаатар хотоос ярьж байна.', 'score': 0.9779232740402222, 'token': 1176, 'token_str': 'нийслэл'}
18# {'sequence': 'Монгол улсын Нийслэл Улаанбаатар хотоос ярьж байна.', 'score': 0.015034765936434269, 'token': 4059, 'token_str': 'Нийслэл'}
19# {'sequence': 'Монгол улсын Ерөнхийлөгч Улаанбаатар хотоос ярьж байна.', 'score': 0.0021413620561361313, 'token': 325, 'token_str': 'Ерөнхийлөгч'}
20# {'sequence': 'Монгол улсын ерөнхийлөгч Улаанбаатар хотоос ярьж байна.', 'score': 0.0008035294013097882, 'token': 1215, 'token_str': 'ерөнхийлөгч'}
21# {'sequence': 'Монгол улсын нийслэлийн Улаанбаатар хотоос ярьж байна.', 'score': 0.0006434018723666668, 'token': 356, 'token_str': 'нийслэлийн'}1@misc{mongolian-bert,
2 author = {Tuguldur, Erdene-Ochir and Gunchinish, Sharavsambuu and Bataa, Enkhbold},
3 title = {BERT Pretrained Models on Mongolian Datasets},
4 year = {2019},
5 publisher = {GitHub},
6 journal = {GitHub repository},
7 howpublished = {\url{https://github.com/tugstugi/mongolian-bert/}}
8}