Views
No views yet
endpoint(训练结束时的权重)。| 方法 | homo co-GRPO |
| 配方 | 旧(722) |
| 训练步数 | 722 |
| 基座 | Qwen/Qwen2.5-VL-7B-Instruct |
| 4-bench avg | 尚未评测 |
eval_reward 选 best。150 题意味着一道题就是 0.67pp,
而各候选 best 之间的差距常常只有 1-4 道题 —— 这个信号被噪声主导,不足以用来挑 checkpoint。
endpoint 吸收了全部训练步数,且对所有方法一视同仁,故作为发布口径。ℹ️ 本 repo 的best/为训练时保存的 best-by-val 权重。
endpoint/ 最终权重(step 722)
training/ trainer_state_endpoint.json —— 每一步的完整指标(等价于 wandb 曲线的原始数据)