Views
No views yet

a-z, A-Z, 0-9)| Metric | CRNN (Base) | CRNN (Finetuned) | Conv-Transformer (Base) | Conv-Transformer (Finetuned) |
|---|---|---|---|---|
| Architecture | CRNN | CRNN | Convolutional Transformer | Convolutional Transformer |
| Training Data | hammer888/captcha-data | hammer888/captcha-data Python Captcha Library | hammer888/captcha-data | hammer888/captcha-data Python Captcha Library |
| # Parameters | 3,570,943 | 3,570,943 | 12,279,551 | 12,279,551 |
| Model Size | 14.3 MB | 14.3 MB | 51.7 MB | 51.7 MB |
| Sequence Accuracy (hammer888/captcha-data) | 96.81% | 92.98% | 97.38% | 95.36% |
| Character Error Rate (CER) (hammer888/captcha-data) | 0.70% | 1.59% | 0.57% | 1.03% |
| Sequence Accuracy (Python Captcha Library) | 9.65% | 86.20% | 11.59% | 88.42% |
| Character Error Rate (CER) (Python Captcha Library) | 43.98% | 2.53% | 38.63% | 2.08% |
| Throughput (img/sec) | 447.26 | 447.26 | 733.00 | 733.00 |
| Compute Hardware | NVIDIA RTX A6000 | NVIDIA RTX A6000 | NVIDIA RTX A6000 | NVIDIA RTX A6000 |
| Link | Graf-J/captcha-crnn-base | Graf-J/captcha-crnn-finetuned | Graf-J/captcha-conv-transformer-base | Graf-J/captcha-conv-transformer-finetuned |
1from transformers import pipeline
2from PIL import Image
3
4# Initialize the pipeline
5pipe = pipeline(
6 task="captcha-recognition",
7 model="Graf-J/captcha-conv-transformer-base",
8 trust_remote_code=True
9)
10
11# Load and predict
12img = Image.open("path/to/image.png")
13result = pipe(img)
14print(f"Decoded Text: {result['prediction']}")
151import torch
2from PIL import Image
3from transformers import AutoModel, AutoProcessor
4
5# Load Model & Custom Processor
6repo_id = "Graf-J/captcha-conv-transformer-base"
7processor = AutoProcessor.from_pretrained(repo_id, trust_remote_code=True)
8model = AutoModel.from_pretrained(repo_id, trust_remote_code=True)
9
10model.eval()
11
12# Load and process image
13img = Image.open("path/to/image.png")
14inputs = processor(img)
15
16# Inference
17with torch.no_grad():
18 outputs = model(inputs["pixel_values"])
19 logits = outputs.logits
20
21# Decode the prediction via CTC logic
22prediction = processor.batch_decode(logits)[0]
23print(f"Prediction: '{prediction}'")
24
