日本語 QA データセット hpprc/mqa-ja を元に、Hard Negative Mining と Cross-Encoder 蒸留スコア付与を施した日本語 retrieval 学習用データセットです。
pairs / triplets / n-tuples の 3 形式と、n-tuples に蒸留スコアを付けて学習価値でソートした top-K サブセット (100k / 250k / 500k / 1m) を提供します。
Dense Retriever / Cross-Encoder / SPLADE などの日本語検索モデル学習および KL Divergence 蒸留に利用できます。
pairs
5,823,586
query, answer
元の (query, positive) ペア (anc → query, pos_ids[0] → answer)。HNM の結果に関わらず全行収録。
triplets
5,823… See the full description on the dataset page:
https://huggingface.co/datasets/mahiyama/mqa-ja.