It is designed to extract handwritten prescription text from medical images using transformer-based OCR.
Use cropped line-level prescription images for best performance.
1from transformers import TrOCRProcessor, VisionEncoderDecoderModel
2from PIL import Image
3
4processor = TrOCRProcessor.from_pretrained("shubham879/trocr-prescription")
5model = VisionEncoderDecoderModel.from_pretrained("shubham879/trocr-prescription")
6
7image = Image.open("sample.png").convert("RGB")
8
9pixel_values = processor(images=image, return_tensors="pt").pixel_values
10
11generated_ids = model.generate(pixel_values)
12
13text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
14
15print(text)
The model performs well on handwritten prescription text at line level with low character-level error.