This dataset is a remastered version of this dataset prepared using Adaption's Adaptive Data platform.
This dataset contains over 10,000 question-answer pairs derived from multilingual document pages, covering languages such as Italian, German, Chinese, Portuguese, and Japanese. Each sample includes the original OCR text, page metadata, and specific queries regarding dates, titles, entities, or content details found within the documents. The data is… See the full description on the dataset page:
https://huggingface.co/datasets/Reubencf/low-resource-multilingual-doc-qa.