本数据集提取自 Polaris-4B 模型的强化学习(RL)训练日志,经过清洗与分层,专门用于 Critic / Reward Model 的训练与分析。
总样本数 (Total Samples): 730,341 条
清洗标准:
移除了所有缺失 idx 键的样本。
对核心数据层(Layer 1)执行了严格的乱码过滤。
2. 数据分层逻辑 (Stratification)
数据集根据 初始解答 ($S_0$) 与 修正后解答 ($S_1$) 的表现分为三个层级:
分层
定义
样本量
核心价值
Layer 1
从错到对 (Improved)
73,431
Layer 2
从错到错 (Failed)
318,700
Layer 3
初始即正确 (Correct)
338,210
针对 Layer 1… See the full description on the dataset page:
https://huggingface.co/datasets/chenth/Critic.