Views
No views yet
1 📊 GRPO Fine-Tuning Progression & Telemetry Log
2┏━━━━━━━━━┳━━━━━━━━━━━━━┳━━━━━━━━━━━━━┳━━━━━━━━━━━━━┳━━━━━━━━━━━━━┳━━━━━━━━━━━━┓
3┃ Step ┃ Mean Reward ┃ Format ┃ Accuracy ┃ KL ┃ GRPO Loss ┃
4┃ ┃ (r_mean) ┃ Reward ┃ Reward ┃ Div (D_KL) ┃ (L_grpo) ┃
5┡━━━━━━━━━╇━━━━━━━━━━━━━╇━━━━━━━━━━━━━╇━━━━━━━━━━━━━╇━━━━━━━━━━━━━╇━━━━━━━━━━━━┩
6│ Step 01 │ 0.42 │ 0.23 │ 0.22 │ 0.0376 │ 1.1934 │
7│ Step 05 │ 0.50 │ 0.34 │ 0.32 │ 0.0581 │ 0.9610 │
8│ Step 10 │ 0.64 │ 0.54 │ 0.48 │ 0.0595 │ 0.7322 │
9│ Step 15 │ 0.72 │ 0.75 │ 0.70 │ 0.0536 │ 0.4367 │
10│ Step 20 │ 0.85 │ 0.92 │ 0.87 │ 0.0586 │ 0.1730 │
11└─────────┴─────────────┴─────────────┴─────────────┴─────────────┴────────────┘<think> tags) and exact math string match (math_reward.py).