Dataset Description
This is a VQA dataset designed to evaluate RAG performance on visually rich documents requiring complex reasoning from ViDoRAG.
Load the dataset
import pandas as pd
import os
import sys
data_name = sys.argv[1]
df = pd.read_parquet(f"data/{data_name}/images.parquet", engine="pyarrow")
output_dir = f"data/{data_name}"
os.makedirs(f"{output_dir}/imgs", exist_ok=True)
foridx, row in df.iterrows():
img_bytes = row['image']['bytes']
output_path = os.path.join(output_dir… See the full description on the dataset page:
https://huggingface.co/datasets/openbmb/EVisRAG-Test-ViDoSeek.