This dataset is the translation of the MS-marco dataset, marking it the first large-scale urdu IR dataset.
The MS MARCO dataset is formed by a collection of 8.8M passages, approximately 530k queries, and at least one relevant passage per query, which were selected by humans.
The development set of MS MARCO comprises more than 100k queries. However, a smaller set of 6,980 queries is used for evaluation in most published works.… See the full description on the dataset page:
https://huggingface.co/datasets/Mavkif/urdu-msmarco-dataset.