Unified evaluation dataset for continual learning OCR in Vision-Language Models.
Split
Category
Level
Samples
Source
english_handwritten_line
English Handwritten
Line
1,500
IAM Handwriting Database
english_handwritten_page
English Handwritten
Page
50
IAM (pseudo-pages)
english_printed_line
English Printed
Line
~1,500
OmniDocBench v1.5
english_printed_page
English Printed
Page
50
OmniDocBench v1.5