AMR-NSFW Roleplay Dataset
Cinderella-Gemma2-2B 模型训练使用的中文 NSFW 角色扮演多轮对话数据集。
指标
数值
源文件数量
98
单轮记录数
489
多轮记录数
489
对话轮次
489
语言
中文
通过 Grok 4.3 清洗流水线:
grok1 → grok2.1-2.5 → mythic-base
审核结论:pass_smoke
每条记录包含:
character_card: 角色卡(名称、性格、外貌、关系等)
system_prompt: 系统提示词
dialogues: 多轮对话历史
model_evaluation: Grok 质量评估
source_file: 原始来源
用于训练和评估中文角色扮演语言模型。