jerteh-355 —
Najveći BERT model specijalno obučen za srpski jezik.
Vektorizuje reči, ili dopunjava nedostajuće reči u tekstu
Zasnovan na RoBERTa-large arhitekturi, 355 miliona parametara
Obučavan na korpusu srpskog jezika veličine 4 milijarde tokena
Najbolji rezultati u modelovanju maskiranog jezika za srpski!
Jednaka podrška unosa i na ćirilici i na latinici!
Pored skupova navedenih u metapodacima, model je obučavan i na ostalim korpusima Društva za jezičke resurse i tehnologije,
uključujući korpuse savremenog srpskog jezika: SrpKor2013 i SrpKor2021,
kao i korpus PDRS 1.0 razvijen od strane Instituta za Srpski jezik SANU.
Upotreba
python
1>>>from transformers import pipeline
2>>> unmasker = pipeline('fill-mask', model='jerteh/jerteh-355')3>>> unmasker("Kada bi čovek znao gde će pasti on bi<mask>.")4>>>
[{'score': 0.2131326049566269, 'token': 11379, 'token_str': ' pao', 'sequence': 'Kada bi čovek znao gde će pasti on bi pao.'},
{'score': 0.18836458027362823, 'token': 20536, 'token_str': ' pobegao', 'sequence': 'Kada bi čovek znao gde će pasti on bi pobegao.'},
{'score': 0.07937008887529373, 'token': 10799, 'token_str': ' umro', 'sequence': 'Kada bi čovek znao gde će pasti on bi umro.'},
{'score': 0.04340635612607002, 'token': 7797, 'token_str': ' otišao', 'sequence': 'Kada bi čovek znao gde će pasti on bi otišao.'},
{'score': 0.038474686443805695, 'token': 25984, 'token_str': ' odustao', 'sequence': 'Kada bi čovek znao gde će pasti on bi odustao.'}]