ConfRAG is a benchmark dataset for evaluating how large language models (LLMs) reason over conflicting information in retrieval-augmented generation (RAG) settings.
Paper: Benchmarking LLM's Capability in Reasoning over Conflicting Web References
Yizhen Yuan, Rui Kong, Dongze Li, Yuanchun Li†, Yunxin Liu
Institute for AI Industry Research (AIR), Tsinghua University · Shanghai Jiao Tong University
Accepted at ACL… See the full description on the dataset page:
https://huggingface.co/datasets/OracleY/ConfRAG.