Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3tok = AutoTokenizer.from_pretrained("Zual/soter-megas")
4model = AutoModelForSeq2SeqLM.from_pretrained("Zual/soter-megas")
5
6# Entrée : <tb_X> forme-épelée <sep> contexte-gauche <tgt> forme </tgt> contexte-droit
7# Conventions : <tb_perseus> (AGDT), <tb_proiel>, <tb_ptnk> (Septante)
8phrase = "Ἀλέξανδρος ἐγένετο βασιλεύς".split()
9i = 1 # lemmatiser ἐγένετο
10inp = f"<tb_perseus> {' '.join(phrase[i])} <sep> {' '.join(phrase[:i])} <tgt> {phrase[i]} </tgt> {' '.join(phrase[i+1:])}"
11out = model.generate(**tok(inp, return_tensors="pt"), max_length=48)
12print(tok.decode(out[0], skip_special_tokens=True)) # γίγνομαι| Système | PROIEL | Perseus | PTNK |
|---|---|---|---|
| Eulexis (dictionnaire) | 87,3 / 88,2 | 89,1 / 90,4 | 86,4 / 86,7 |
| Stanza | 95,5 / 96,0 | 92,0 / 92,8 | 82,8 / 83,5 |
| GreTa+dict (223M) | 97,0 / 97,5 | 94,4 / 94,9 | 97,4 / 97,4 |
| Sōtēr Megas (581M) | 95,6 / 97,1 | 95,3 / 98,4 | 98,4 / 98,9 |