Qwen3.5-9B SFT - DeepSeek Success Only (3 epochs)
基于 Qwen3.5-9B 在 DeepSeek 全部成功轨迹上训练 3 epoch 的 SFT 模型。
训练数据
- 数据集:
tmax_deepseek_v4flash_multi_success.parquet
- 样本数:6163 条(全部 reward=1)
- 训练步数:145 步(3 epochs)
训练配置
- 基座模型:Qwen3.5-9B
- 优化器:AdamW
- 学习率:2e-5(linear scheduler,warmup_ratio=0.03)
- 权重衰减:0.0
- 全局批量:128(4卡 × 1 × 32 gradient_accumulation_steps)
- 序列长度:16384
- 精度:bf16
- DeepSpeed:ZeRO-3 stage3(no offloading)
- 硬件:4×H200
- Seed:42
用途
对照实验腿1:仅在成功轨迹上训练,用于与含失败轨迹模型对比效果差异。