Views
No views yet
1from transformers import DonutProcessor, VisionEncoderDecoderModel
2from PIL import Image
3import torch
4
5# Load the model and processor
6processor = DonutProcessor.from_pretrained("chinmays18/medical-prescription-ocr")
7model = VisionEncoderDecoderModel.from_pretrained("chinmays18/medical-prescription-ocr")
8
9# Move to GPU if available
10device = "cuda" if torch.cuda.is_available() else "cpu"
11model.to(device)
12
13# Process an image
14image = Image.open("prescription.jpg").convert("RGB")
15pixel_values = processor(images=image, return_tensors="pt").pixel_values.to(device)
16
17# Generate text
18task_prompt = "<s_ocr>"
19decoder_input_ids = processor.tokenizer(task_prompt, return_tensors="pt").input_ids.to(device)
20
21generated_ids = model.generate(
22 pixel_values,
23 decoder_input_ids=decoder_input_ids,
24 max_length=512,
25 num_beams=1,
26 early_stopping=True
27)
28
29# Decode the generated text
30generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
31print(generated_text)1@misc{shrivastava2024medicalocr,
2 author = {Chinmay Shrivastava},
3 title = {Medical Prescription OCR},
4 year = {2024},
5 publisher = {Hugging Face},
6 journal = {Hugging Face Model Hub},
7 url = {https://huggingface.co/chinmays18/medical-prescription-ocr}
8}datasets field from custom-iam-medical to chinmays18/medical-prescription-dataset to properly link to your dataset.