Dataset Card for presightai/arabic_doc_to_markdown
This dataset contains OCR image–markdown pairs specifically curated for document structure retrieval and reconstruction tasks,focusing on Arabic and English documents across a variety of domains.
Dataset Summary
Source of Information:This dataset was created by crawling publicly accessible Arabic and English PDFs from: