Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3# Load model and tokenizer
4model_name = "johnlockejrr/aramaic-diacritization-model"
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
7
8# Example input (consonantal Aramaic text)
9consonantal_text = "בקדמין ברא יי ית שמיא וית ארעא"
10
11# Tokenize input
12inputs = tokenizer(consonantal_text, return_tensors="pt", max_length=512, truncation=True)
13
14# Generate vocalized text
15outputs = model.generate(**inputs, max_length=512, num_beams=4, early_stopping=True)
16
17# Decode output
18vocalized_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
19print(f"Input: {consonantal_text}")
20print(f"Output: {vocalized_text}")1from transformers import pipeline
2
3diacritizer = pipeline("text2text-generation", model="johnlockejrr/aramaic-diacritization-model")
4
5# Process text
6consonantal_text = "בראשית ברא אלהים את השמים ואת הארץ"
7vocalized_text = diacritizer(consonantal_text)[0]['generated_text']
8print(vocalized_text)1@misc{aramaic-diacritization-2024,
2 title={Aramaic Diacritization Model},
3 author={John Locke Jr.},
4 year={2025},
5 howpublished={Hugging Face Model Hub},
6 url={https://huggingface.co/johnlockejrr/aramaic-diacritization-model}
7}model.safetensors - Model weights (234MB)config.json - Model configurationtokenizer_config.json - Tokenizer configurationsource.spm / target.spm - SentencePiece modelsvocab.json - Vocabulary filegeneration_config.json - Generation parameterstrain_arc2arc_improved_deep.py - Main training scriptrun_arc2arc_improved_deep.sh - Training execution scriptrun_resume_arc2arc_deep.sh - Resume training script