A fine-tuned
TrOCR model for printed Tigrinya line-level text recognition.
This is the
handwritten pre-training variant, fine-tuned from
microsoft/trocr-base-handwritten using vocabulary extension and
Word-Aware Loss Weighting
to resolve word-boundary failures caused by BPE space-marker conventions.
Evaluated on a held-out test set of 5,000 synthetic Tigrinya text-line images.
1from transformers import VisionEncoderDecoderModel, TrOCRProcessor
2from PIL import Image
3
4processor = TrOCRProcessor.from_pretrained("Yonatanhaile2026/tigrinya-trocrhandwritten")
5model = VisionEncoderDecoderModel.from_pretrained("Yonatanhaile2026/tigrinya-trocrhandwritten")
6
7Load your text-line image
8image = Image.open("your_tigrinya_text_line.png").convert("RGB")
9
10pixel_values = processor(images=image, return_tensors="pt").pixel_values
11generated_ids = model.generate(pixel_values, num_beams=5, max_length=128)
12prediction = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
13print(prediction)
14
1@misc{medhanie2026adaptingtrocrprintedtigrinya,
2 title={Adapting TrOCR for Printed Tigrinya Text Recognition: Word-Aware Loss Weighting for Cross-Script Transfer Learning},
3 author={Yonatan Haile Medhanie and Yuanhua Ni},
4 year={2026},
5 eprint={2604.20813},
6 archivePrefix={arXiv},
7 primaryClass={cs.CV},
8 url={https://arxiv.org/abs/2604.20813},
9}
10