Medical-ChatBot-DPO 数据集
数据集概述
本数据集是一个用于 DPO (Direct Preference Optimization) 训练的偏好对齐数据集,专门为医疗对话机器人设计。数据集包含 40,672 条样本,融合了通用对话安全性、人类偏好对齐和医疗领域专业知识。
数据来源与处理
1. Anthropic/hh-rlhf (harmless-base)
数据量: 10,000 条
来源: Anthropic/hh-rlhf
子集: harmless-base (无害对话子集)
处理方式:
从原始对话中提取最后一轮 Human-Assistant 对话
从 chosen 字段提取最后的 Assistant 回复作为 chosen(安全的拒绝回复)
从 rejected 字段提取最后的 Assistant 回复作为 rejected(有帮助但可能有害的回复)
过滤掉无效样本(prompt 为空的样本)
随机采样 10,000 条(seed=42)