このデータセットは抽出されたハードネガティブ、質問とテキストをさらに細かく区切ったspanとの関連度スコア、さらにリランカーのスコアが含まれており、OpenProvence などのモデル学習に利用できます。
サブセットごとに元データが異なるため、ライセンスはそれぞれの提供元に従ってください。
重複除去の有無ごとにサブセット構成をまとめました。freq2 系は MD5 ベースの頻度フィルタでデータセット全体に同一テキストが 3 回以上出現しないよう調整しており、軽量でバランスの良い学習データが欲しい場合はこちらを推奨します。同じテキストが繰り返し登場すると context_spans_relevance が過学習しやすくなるため、剪定モデルの訓練では重複を抑えることを推奨します。
サブセット
行数 (train / val / test)
テキスト重複率
推奨
msmarco-ja
492,729 / 5,000 / 5,000
約 38.9%
msmarco-ja-freq2
260,436 / 1,000… See the full description on the dataset page:
https://huggingface.co/datasets/hotchpotch/japanese-context-relevance.