Views
No views yet
| base | google/gemma-3-4b-it @ 093f9f388b31de276ce2de164bdc2081324b9767 |
| 訓練資料 | self_solution_sft.jsonl,sha256 346f75ece314dd0612f652824c9993c28fcc5577f7024547848ebab0c5268341(530 筆) |
| seed | 44 |
| 配方 | lr 1e-4、epochs 1.0、max_length 4096、per-device 1 × grad-accum 8 |
adapter_model.safetensors sha256 | 6872a0fc09cd9b3736b4fbd4aaaff6fa83a9a85c57984cced35af6a7ab49347c |
| held-out Δ vs base(n=2538,direct-axis 尺) | -0.32pp |
control —— 265 筆訓練目標是外部老師(deepseek-v4-pro)的解+265 筆 base 自己的正解 replayselfsol —— 同一批 265 題、同一批 replay、同配方同 seed,
唯一差別是那 265 筆的目標文字換成 base 自己最短的正解direct-axis-balanced-box-v2.1-timeout-safe+math-verify-0.9.0,
不可與 math-mathverify-v1 或 math-mathverify-terminal-v2 家族的數字相減。parse() 會回 [])。