Views
No views yet
Aurorra1123/tmax-selfdistill-datasets 中 Qwen3.5-9B on-policy 采集、reward==1 的成功轨迹。| 项 | 值 |
|---|---|
| 基座 | Qwen3.5-9B |
| 学习率 | 2e-5 |
| 调度器 | linear,warmup 0.03 |
| weight_decay | 0.0 |
| epoch | 1 |
| 全局 batch size | 128 |
| max_seq_length | 16384 |
| 优化步数 | 34 |
| 精度 | bf16,DeepSpeed ZeRO-3(无 offload) |
| 硬件 | 4×H200 |
| 框架 | open-instruct(finetune.py) |
Aurorra1123/tmax-9b-sft-deepseek-4264(同样 4264 条、34 步,数据来源为 DeepSeek 教师成功轨迹)。两腿唯一变量为训练数据来源。