Views
No views yet
python3 ./trdg/run.py -i ocr_dataset_poc.txt -w 5 -t {num_cores} -f 64 -l ko -c {num_samples} -na 2 --output_dir {dataset_dir}facebook/deit-base-distilled-patch16-384 and the decoder model used camembert-base. It is easier than training by starting weights from microsoft/trocr-base-stage1.1from transformers import TrOCRProcessor, VisionEncoderDecoderModel, AutoTokenizer
2import requests
3from io import BytesIO
4from PIL import Image
5
6processor = TrOCRProcessor.from_pretrained("microsoft/trocr-base-handwritten")
7model = VisionEncoderDecoderModel.from_pretrained("agomberto/trocr-base-printed-fr")
8tokenizer = AutoTokenizer.from_pretrained("agomberto/trocr-base-printed-fr")
9
10url = "https://github.com/agombert/trocr-base-printed-fr/blob/main/sample_imgs/0.jpg"
11response = requests.get(url)
12img = Image.open(BytesIO(response.content))
13
14pixel_values = processor(img, return_tensors="pt").pixel_values
15generated_ids = model.generate(pixel_values, max_length=32)
16generated_text = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
17print(generated_text)