日本語の行政 FAQ を題材に、Hard Negative Mining と Cross-Encoder 蒸留スコア付与を施した日本語 retrieval 学習用データセットです。
ベースは sbintuitions/JMTEB の Retrieval タスク jagovfaqs_22k の train split で、(query, positive) ペアを作った上で、cl-nagoya/ruri-v3-310m による Dense Retriever ベースの kNN 検索でハードネガティブを採掘し、cl-nagoya/ruri-v3-reranker-310m によるリランキング (蒸留スコア付与) を施しています。
pairs / triplets / n-tuples の 3 形式と、n-tuples を quality_score で validated にフィルタしたサブセット… See the full description on the dataset page:
https://huggingface.co/datasets/mahiyama/JaGovFaqs-22k.