This dataset is a Nano-style retrieval dataset for HAKARI-bench.
NanoMLDR contains multilingual retrieval splits derived from Shitao/MLDR revision refs/convert/parquet. Malformed or non-question query strings are filtered before sampling.
queries = load_dataset(dataset_id, "queries", split=split)
corpus = load_dataset(dataset_id, "corpus", split=split)
qrels =… See the full description on the dataset page:
https://huggingface.co/datasets/hakari-bench/NanoMLDR.