This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Source Dataset: davanstrien/encyclopaedia-britannica-1771
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 2,724
Processing Time: 376.7 min
Processing Date: 2026-02-18 20:29 UTC
Image Column: image
Output Column: markdown… See the full description on the dataset page:
https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-full.