This dataset contains evaluation benchmarks for information retrieval (IR) and reasoning-intensive retrieval tasks (BRIGHT).
Subsets
IR Evaluation (Sample-50)
2wikimultihopqa: data/2wikimultihopqa/test.jsonl
bamboogle: data/bamboogle/test.jsonl
beir_arguana: data/beir_arguana/test.jsonl
beir_scifact: data/beir_scifact/test.jsonl
hotpotqa: data/hotpotqa/test.jsonl
musique: data/musique/test.jsonl
nq:… See the full description on the dataset page: https://huggingface.co/datasets/DCI-Agent/dci-bench.