This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using LightOnOCR, a fast and compact 1B OCR model.
Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset
Model: lightonai/LightOnOCR-0.9B-32k-1025
Vocabulary Size: 32k tokens
Number of Samples: 4,096
Processing Time: 27.8 min
Processing Date: 2025-10-24 12:35 UTC… See the full description on the dataset page:
https://huggingface.co/datasets/davanstrien/handbooks-lighton-ocr-32k-test.