Views
No views yet
endpoint(训练结束时的权重)。| 方法 | homo co-GRPO |
| 配方 | 旧(722) |
| 训练步数 | 722 |
| 基座 | OpenGVLab/InternVL3_5-8B-HF |
| 4-bench avg(endpoint) | 55.81 |
eval_reward 选 best。150 题意味着一道题就是 0.67pp,
而各候选 best 之间的差距常常只有 1-4 道题 —— 这个信号被噪声主导,不足以用来挑 checkpoint。
endpoint 吸收了全部训练步数,且对所有方法一视同仁,故作为发布口径。ℹ️ 该 run 未产生 best-by-val 记录。
endpoint/ 最终权重(step 722)
training/ trainer_state_endpoint.json —— 每一步的完整指标(等价于 wandb 曲线的原始数据)