Views
No views yet
| base | google/gemma-3-4b-it @ 093f9f388b31de276ce2de164bdc2081324b9767 |
| 訓練資料 | dose_control_sft.jsonl,sha256 d99f688c01d152b068caa9a8343fc47b29abe6ea65fd7911fc9bcfba4207a437(530 筆) |
| seed | 42 |
| 配方 | lr 1e-4、epochs 1.0、max_length 4096、per-device 1 × grad-accum 8 |
adapter_model.safetensors sha256 | 8d7e35579d5c55fabc9104a8b70ec6a68df2931d08c312e294c3697a4afd02b7 |
| held-out Δ vs base(n=2538,direct-axis 尺) | -5.83pp |
control —— 265 筆訓練目標是外部老師(deepseek-v4-pro)的解+265 筆 base 自己的正解 replayselfsol —— 同一批 265 題、同一批 replay、同配方同 seed,
唯一差別是那 265 筆的目標文字換成 base 自己最短的正解direct-axis-balanced-box-v2.1-timeout-safe+math-verify-0.9.0,
不可與 math-mathverify-v1 或 math-mathverify-terminal-v2 家族的數字相減。parse() 會回 [])。