Subset metrics by evidence source:
Chart: samples=5, accuracy=40.00%
Pure-text (Plain-text): samples=2, accuracy=0.00%
Generalized-text (Layout): samples=1, accuracy=0.00%
Table: samples=1, accuracy=0.00%
Subset metrics by evidence pages length:
no_pages: samples=2, accuracy=100.00%
single_page: samples=4, accuracy=50.00%
multiple_pages: samples=4, accuracy=0.00%
Done: Results saved to… See the full description on the dataset page:
https://huggingface.co/datasets/happy8825/MMLongBench_var9_doc_memory_images.