Views
No views yet
python3 ./trdg/run.py -i ocr_dataset_poc.txt -w 5 -t {num_cores} -f 64 -l ko -c {num_samples} -na 2 --output_dir {dataset_dir}facebook/deit-base-distilled-patch16-384 and the decoder model used klue/roberta-base. It is easier than training by starting weights from microsoft/trocr-base-stage1.1from transformers import TrOCRProcessor, VisionEncoderDecoderModel, AutoTokenizer
2import requests
3from io import BytesIO
4from PIL import Image
5
6processor = TrOCRProcessor.from_pretrained("microsoft/trocr-base-handwritten")
7model = VisionEncoderDecoderModel.from_pretrained("daekeun-ml/ko-trocr-base-nsmc-news-chatbot")
8tokenizer = AutoTokenizer.from_pretrained("daekeun-ml/ko-trocr-base-nsmc-news-chatbot")
9
10url = "https://raw.githubusercontent.com/aws-samples/sm-kornlp/main/trocr/sample_imgs/news_1.jpg"
11response = requests.get(url)
12img = Image.open(BytesIO(response.content))
13
14pixel_values = processor(img, return_tensors="pt").pixel_values
15generated_ids = model.generate(pixel_values, max_length=64)
16generated_text = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
17print(generated_text)