Traditional Chinese OCR Synthetic Dataset
A large-scale synthetic dataset containing 4.1 million image-text pairs specifically designed for Traditional Chinese historical document recognition.
Existing large-scale Traditional Chinese OCR datasets (e.g., TCSynth) are primarily designed for scene text recognition, characterized by:
Horizontal layouts
Short text sequences (2-5 characters on average)
Modern commonly-used characters