Views
No views yet


1from transformers import VisionEncoderDecoderModel, TrOCRProcessor
2import torch
3from PIL import Image
4
5# Load model and processor
6processor = TrOCRProcessor.from_pretrained("anuashok/ocr-captcha-v3")
7model = VisionEncoderDecoderModel.from_pretrained("anuashok/ocr-captcha-v3")
8
9# Load image
10image = Image.open('path_to_your_image.jpg').convert("RGB")
11# Load and preprocess image for display
12image = Image.open(image_path).convert("RGBA")
13# Create white background
14background = Image.new("RGBA", image.size, (255, 255, 255))
15combined = Image.alpha_composite(background, image).convert("RGB")
16
17# Prepare image
18pixel_values = processor(combined, return_tensors="pt").pixel_values
19
20# Generate text
21generated_ids = model.generate(pixel_values)
22generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
23print(generated_text)