A curated OCR dataset for training PaddleOCR models on medical documents while maintaining general OCR capabilities through domain-balanced training.
Dataset Description
Dataset Summary
MedOCR-Vision is a carefully curated dataset combining medical and general documents to train robust OCR models. The dataset prevents catastrophic forgetting by maintaining a balanced distribution between medical (59.4%) and general (40.6%) domains.