Views
No views yet
1from transformers import TrOCRProcessor, VisionEncoderDecoderModel
2from PIL import Image
3
4# Load model and processor
5processor = TrOCRProcessor.from_pretrained("ZihCiLin/trocr-traditional-chinese-historical-finetune")
6model = VisionEncoderDecoderModel.from_pretrained("ZihCiLin/trocr-traditional-chinese-historical-finetune")
7
8# Load historical document image
9image = Image.open("historical_manuscript.jpg").convert("RGB")
10
11# Generate text
12pixel_values = processor(image, return_tensors="pt").pixel_values
13generated_ids = model.generate(pixel_values)
14generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
15
16print(generated_text)1# See: https://github.com/Jason9339/traditional-chinese-historical-document-ocr-llm-fusion
2# Fusion with Breeze-7B improves CER by 10% on historical documents1@inproceedings{lin2026decoding,
2 title={Decoding-Time Fusion of OCR and Large Language Models for Traditional Chinese Historical Document Recognition},
3 author={Lin, Zih-Ci and Liao, Wen-Hung},
4 booktitle={International Conference on Pattern Recognition (ICPR)},
5 year={2026}
6}