Views
No views yet
1from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("LoveJesus/biblical-parser-chirho")
4model = AutoModelForSeq2SeqLM.from_pretrained("LoveJesus/biblical-parser-chirho")
5
6# Parse a Hebrew word
7input_text = 'parse [hebrew]: בָּרָא [GEN 1:1] context: בְּרֵאשִׁית אֱלֹהִים'
8inputs = tokenizer(input_text, return_tensors="pt")
9outputs = model.generate(**inputs, max_length=128)
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))
11# Expected: "class:verb | stem:qal | lemma:ברא | morph:... | person:3 | gender:m | number:s | gloss:he created"
12
13# Parse a Greek word
14input_text = 'parse [greek]: λόγος [JHN 1:1] context: ἐν ἀρχῇ ἦν'
15inputs = tokenizer(input_text, return_tensors="pt")
16outputs = model.generate(**inputs, max_length=128)
17print(tokenizer.decode(outputs[0], skip_special_tokens=True))parse [{language}]: {word} [{verse_ref}] context: {surrounding_words}{language}: hebrew or greek{word}: The biblical word in original script{verse_ref}: Book chapter:verse reference{surrounding_words}: 2 words before and after for disambiguationclass:{pos} | stem:{stem} | lemma:{lemma} | morph:{code} | person:{p} | gender:{g} | number:{n} | gloss:{english}| Property | Value |
|---|---|
| Base model | google/mt5-small (300M params) |
| Architecture | Encoder-decoder (Seq2Seq) |
| Languages | Biblical Hebrew, Koine Greek |
| Training | 5 epochs, lr=3e-4, batch=32 |
| Hardware | NVIDIA A100/H200 GPU |
| Metric | Score |
|---|---|
| Exact Match (all tags correct) | 0.525 |
| Average Tag F1 (across all tags) | 0.886 |
| Tag | F1 |
|---|---|
| class (POS) | 0.963 |
| number | 0.966 |
| POS | 0.958 |
| lemma | 0.935 |
| person | 0.933 |
| gender | 0.928 |
| type | 0.900 |
| morph | 0.890 |
| state | 0.878 |
| stem | 0.859 |
| gloss | 0.539 |
| Language | Exact Match |
|---|---|
| Hebrew | 0.514 |
| Greek | 0.559 |
Theglosstag (English translation) is the hardest to predict exactly, pulling down the overall exact match rate. The model achieves strong F1 on structural/morphological tags (class, number, POS, person, gender all > 0.92).