關於有用且無害的人類偏好數據,來自 Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback。這些數據旨在為後續 RLHF 訓練訓練偏好(或獎勵)模型。這些資料不用於對話代理人的監督訓練。根據這些資料訓練對話代理可能會導致有害的模型,這種情況應該避免。
人工生成並帶註釋的紅隊對話,來自減少危害的紅隊語言模型:方法、擴展行為和經驗教訓。這些數據旨在了解眾包紅隊如何建模以及哪些類型的紅隊攻擊成功或失敗。這些數據不用於微調或偏好建模(使用上面的數據進行偏好建模)。這些數據是從上述無害偏好建模數據導出的對話的完整轉錄本,其中僅將所選響應合併到整個轉錄本中。此外,文字記錄也透過人工和自動測量來標註整個對話的危害程度。
特別注意… See the full description on the dataset page: https://huggingface.co/datasets/erhwenkuo/hh_rlhf-chinese-zhtw.