This output bundle stores OCR results for arXiv PDFs using datalab-to/chandra-ocr-2.
Output dataset: nielsr/arxiv-chandra-ocr-1000-20260329-p30
Output bucket: hf://buckets/nielsr/arxiv-chandra-ocr-1000-20260329-p30
Source paper IDs in input list: 27,584
Processed IDs recorded in state/processed_ids.txt: 610
Successes: 609
Partial successes: 0
Errors: 1
Next shard index: 61
Updated at: 2026-03-30T14:35:34.407965+00:00… See the full description on the dataset page:
https://huggingface.co/datasets/nielsr/arxiv-chandra-ocr-1000-20260329-p30.