This dataset is a Nano-style retrieval dataset for HAKARI-bench.
NanoLongEmbed contains Nano-style long-context retrieval splits derived from LongEmbed tasks.
queries = load_dataset(dataset_id, "queries", split=split)
corpus = load_dataset(dataset_id, "corpus", split=split)
qrels = load_dataset(dataset_id, "qrels", split=split)… See the full description on the dataset page:
https://huggingface.co/datasets/hakari-bench/NanoLongEmbed.