RLRefine Dataset 是用于中文电商评论结构化关键词抽取的合成后训练数据集。数据通过
LLM-assisted 合成流水线生成,围绕同一批任务 Prompt 派生出 SFT、DPO 和 GRPO 三种
训练格式。该数据集由 RLRefine 项目产出。
本仓库保留 RLRefine checkpoint-924 后训练流程所使用的数据表示。发布文件保持原始训练
分布,没有去重、重排或重新生成,不应作为独立评测集使用。
grpo
data/checkpoint_924/grpo.jsonl
3,698
GRPO… See the full description on the dataset page:
https://huggingface.co/datasets/xinyuran/RLRefine-Dataset.