Views
No views yet
paudelanil/trocr-devanagari-2 using the PEFT (Parameter-Efficient Fine-Tuning) library.paudelanil/trocr-devanagari-2[!IMPORTANT] This model is an OCR engine for word-level recognition. It does not perform page layout analysis, table extraction, or full-page segmentation.
transformers, peft, and torch installed.1from peft import PeftModel
2from transformers import AutoTokenizer, TrOCRProcessor, ViTImageProcessor, VisionEncoderDecoderModel
3import torch
4from PIL import Image
5
6base_model_id = "paudelanil/trocr-devanagari-2"
7adapter_id = "manishwagle/devgen-trocr-devanagari-lora" # Or local path
8
9# Load processors
10image_processor = ViTImageProcessor.from_pretrained(base_model_id)
11tokenizer = AutoTokenizer.from_pretrained(base_model_id)
12processor = TrOCRProcessor(image_processor=image_processor, tokenizer=tokenizer)
13
14# Load model
15device = "cuda" if torch.cuda.is_available() else "cpu"
16base_model = VisionEncoderDecoderModel.from_pretrained(base_model_id)
17model = PeftModel.from_pretrained(base_model, adapter_id)
18model.to(device)
19
20# Inference
21image = Image.open("sample_handwritten_word.png").convert("RGB")
22pixel_values = processor(image, return_tensors="pt").pixel_values.to(device)
23
24generated_ids = model.generate(pixel_values)
25generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
26
27print(f"Recognized Text: {generated_text}")