Views
No views yet

| Model | Resolved | Resolved rate |
|---|---|---|
| Qwen3.5-4B | 224 / 500 | 44.8% |
| Raw RFT | 255 / 500 | 51.0% |
| Refined SFT | 275 / 500 | 55.0% |


| Setting | Value |
|---|---|
| Base checkpoint | Qwen/Qwen3.5-4B |
| Fine-tuning method | Full-parameter SFT |
| Framework | ms-swift |
| Hardware | 2 × NVIDIA A100 80GB |
| Distributed training | DeepSpeed ZeRO-3, sequence parallel size 2 |
| Precision | bfloat16 |
| Training / validation examples | 2,784 / 309 |
| Epochs | 2 |
| Optimizer steps | 1,392 |
| Per-device batch size | 1 |
| Gradient accumulation | 4 |
| Maximum sequence length | 65,536 tokens |
| Learning rate | 1e-5 |
| Schedule | Cosine decay, 5% warmup |
| Training runtime | Approximately 17 hours |