Views
No views yet
endpoint(训练结束时的权重)。| 方法 | heter co-GRPO |
| 配方 | MM-UPT |
| 训练步数 | 481 |
| 基座 | google/gemma-3-12b-it |
| 4-bench avg | 尚未评测 |
eval_reward 选 best。150 题意味着一道题就是 0.67pp,
而各候选 best 之间的差距常常只有 1-4 道题 —— 这个信号被噪声主导,不足以用来挑 checkpoint。
endpoint 吸收了全部训练步数,且对所有方法一视同仁,故作为发布口径。⚠️ best-by-val 在 step 140,eval_reward0.4803 —— 该数据从trainer_state反推得到。 但 step 140 的权重已不存在(训练时只保留了末尾几个 checkpoint),因此本 repo 只有endpoint/。 此事实如实记录,不以其他重启轨迹的 best 冒充。
endpoint/ 最终权重(step 481)
training/ trainer_state_endpoint.json —— 每一步的完整指标(等价于 wandb 曲线的原始数据)