Views
No views yet
1from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("LoveJesus/biblical-glosser-chirho")
4model = AutoModelForSeq2SeqLM.from_pretrained("LoveJesus/biblical-glosser-chirho")
5
6# Gloss Genesis 1:1
7input_text = 'gloss [hebrew]: בְּרֵאשִׁית בָּרָא אֱלֹהִים אֵת הַשָּׁמַיִם וְאֵת הָאָרֶץ [GEN 1:1]'
8inputs = tokenizer(input_text, return_tensors="pt")
9outputs = model.generate(**inputs, max_length=256)
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))
11# Expected: "In-beginning | created | God | [direct object marker] | the-heavens | and | the-earth"
12
13# Gloss John 1:1
14input_text = 'gloss [greek]: Ἐν ἀρχῇ ἦν ὁ λόγος [JHN 1:1]'
15inputs = tokenizer(input_text, return_tensors="pt")
16outputs = model.generate(**inputs, max_length=256)
17print(tokenizer.decode(outputs[0], skip_special_tokens=True))
18# Expected: "In | [the] beginning | was | the | Word"gloss [{language}]: {verse_text_in_original_script} [{verse_ref}]|:word1_gloss | word2_gloss | word3_gloss | ...| Property | Value |
|---|---|
| Base model | google/mt5-small (300M params) |
| Architecture | Encoder-decoder (Seq2Seq) |
| Languages | Biblical Hebrew, Koine Greek |
| Training | 8 epochs, lr=3e-4, batch=16 |
| Hardware | NVIDIA A100/H200 GPU |
| Metric | Score |
|---|---|
| BLEU | 22.06 |
| Word Accuracy | 0.20 |
BLEU measures n-gram overlap between predicted and reference glosses. Word accuracy measures exact word-level match rate. Interlinear glossing is challenging because many Hebrew/Greek words have multiple valid English glosses, so these metrics represent a lower bound on actual quality.