This dataset contains synthetic document-ground truth pairs for Traditional Chinese text recognition training. The dataset is generated using the SynthDoG (Synthetic Document Generation) framework, which creates realistic document images with Traditional Chinese text.
Dataset Structure
The dataset is organized into three splits:
train/: Training data
validation/: Validation data
test/: Test data