split=AIFT_M1 は HachiML/Mistral-7B-v0.3-m1-lora
split=AIFT_M2 は HachiML/Mistral-7B-v0.3-m2-lora
でそれぞれself-rewardingして作成したAIFT(AI Feedback Tuning) dataです。
手順は以下の通りです。
HachiML/self-rewarding_instructのInstructionに対する回答を各モデルで4つずつ作成
回答に対して各モデルで点数評価
最高評価の回答をchosen、最低評価の回答をrejectedとする
詳細はself-rewardingの論文を参照してください。
Dataset Details
Dataset Description
Curated by: HachiMLLanguage(s) (NLP):… See the full description on the dataset page:
https://huggingface.co/datasets/HachiML/self-rewarding_AIFT_MSv0.3_lora.