This dataset contains OCR results from biglam/rubenstein-manuscript-catalog using Qianfan-OCR, Baidu's 4.7B end-to-end document intelligence model.
Source Dataset: biglam/rubenstein-manuscript-catalog
Model: baidu/Qianfan-OCR
Number of Samples: 5
Processing Time: 5.9 min
Processing Date: 2026-03-19 15:50 UTC
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 8… See the full description on the dataset page:
https://huggingface.co/datasets/davanstrien/qianfan-ocr-scene-test.