This dataset contains OCR results from images in princeton-nlp/CharXiv using dots.mocr, a 3B multilingual model with SOTA document parsing and SVG generation.
Source Dataset: princeton-nlp/CharXiv
Model: rednote-hilab/dots.mocr-svg
Number of Samples: 3
Processing Time: 3.8 min
Processing Date: 2026-03-19 17:52 UTC
Image Column: image
Output Column: markdown
Dataset Split: test
Batch Size:… See the full description on the dataset page:
https://huggingface.co/datasets/davanstrien/test-dots-mocr-svg.