Views
No views yet

emelnov/ocr-captcha-v4-mailru — это дообученная версия microsoft/trocr-base-printed (или anuashok/ocr-captcha-v3, если применимо), предназначенная для распознавания текста на CAPTCHA-изображениях. Она была обучена на датасете из 1,000 CAPTCHA-изображений с платформы Mail.ru и достигла 98% точности на этом тестовом наборе.microsoft/trocr-base-printed (и/или anuashok/ocr-captcha-v3)transformers, torch и Pillow.1import torch
2from PIL import Image
3from transformers import TrOCRProcessor, VisionEncoderDecoderModel
4
5# Загрузка модели и процессора
6model_name = "emelnov/ocr-captcha-v4-mailru"
7processor = TrOCRProcessor.from_pretrained(model_name)
8model = VisionEncoderDecoderModel.from_pretrained(model_name).to(
9 torch.device("cuda" if torch.cuda.is_available() else "cpu")
10)
11
12# Функция для предсказания текста
13def predict_text(image_path):
14 image = Image.open(image_path).convert("RGB")
15 pixel_values = processor(images=image, return_tensors="pt").pixel_values.to(model.device)
16 model.eval()
17 with torch.no_grad():
18 output_ids = model.generate(pixel_values)
19 predicted_text = processor.batch_decode(output_ids, skip_special_tokens=True)[0]
20 return predicted_text
21
22# Пример использования
23image_path = "path_to_your_captcha_image.jpg"
24print(f"Распознанный текст: {predict_text(image_path)}")emelnov/ocr-captcha-v4-mailru model is a fine-tuned version of microsoft/trocr-base-printed (or anuashok/ocr-captcha-v3 if applicable), designed for recognizing text in CAPTCHA images. It was trained on a dataset of 1,000 CAPTCHA images from the Mail.ru platform and achieved 98% accuracy on this test set.microsoft/trocr-base-printed (and/or anuashok/ocr-captcha-v3)transformers, torch, and Pillow libraries are installed.1import torch
2from PIL import Image
3from transformers import TrOCRProcessor, VisionEncoderDecoderModel
4
5# Load the model and processor
6model_name = "emelnov/ocr-captcha-v4-mailru"
7processor = TrOCRProcessor.from_pretrained(model_name)
8model = VisionEncoderDecoderModel.from_pretrained(model_name).to(
9 torch.device("cuda" if torch.cuda.is_available() else "cpu")
10)
11
12# Function to predict text
13def predict_text(image_path):
14 image = Image.open(image_path).convert("RGB")
15 pixel_values = processor(images=image, return_tensors="pt").pixel_values.to(model.device)
16 model.eval()
17 with torch.no_grad():
18 output_ids = model.generate(pixel_values)
19 predicted_text = processor.batch_decode(output_ids, skip_special_tokens=True)[0]
20 return predicted_text
21
22# Example usage
23image_path = "path_to_your_captcha_image.jpg"
24print(f"Recognized text: {predict_text(image_path)}")