The codec dataset, provided by the ir-datasets package.
For more information about the dataset, see the documentation.
This dataset provides:
docs (documents, i.e., the corpus); count=729,824
queries (i.e., topics); count=42
qrels: (relevance assessments); count=6,186
This dataset is used by: codec_economics, codec_history, codec_politics
from datasets import load_dataset
docs = load_dataset('irds/codec', 'docs')
for… See the full description on the dataset page:
https://huggingface.co/datasets/irds/codec.