Views
No views yet
1import torch
2from transformers import TrOCRProcessor, VisionEncoderDecoderModel
3from PIL import Image
4
5model_name = "https://huggingface.co/G1Gru/TrOCR_StreetViewText"
6processor = TrOCRProcessor.from_pretrained(model_name)
7model = VisionEncoderDecoderModel.from_pretrained(model_name)
8device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
9model.to(device)
10
11image = Image.open("path/to/your/image.jpg").convert("RGB")
12
13pixel_values = processor(images=image, return_tensors="pt").pixel_values.to(device)
14
15
16generated_ids = model.generate(pixel_values)
17generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]