Views
No views yet
Qwen/Qwen3.5-9B. It is a PEFT LoRA adapter only; load it with the base Qwen/Qwen3.5-9B checkpoint.| Field | Value |
|---|---|
| Adapter repo | benchflow/benchflow-qwen35-9b |
| Published model PR | HF PR #4 |
| Adapter commit promoted from PR | 92380a83764ec2d8b2103a3895e24e49a508d1d9 |
| Training run id | qwen35-397b-data-qwen35-9b-custom-sft-20260630T042600Z |
| Base checkpoint | Qwen/Qwen3.5-9B |
| Adapter type | LoRA / PEFT |
| Trainer | Custom PyTorch + PEFT LoRA trainer, experiments/env-0-posttrain-mvp/train_lora_sft.py |
| Source data | Qwen3.5-397B teacher trajectories collected with BenchFlow, OpenHands, and Daytona |
| Training rows | 298 all-training-ready rows |
| Hardware | 1x H100 80GB |
prime-rl only because the trajectories were also validated and exported in Prime-SFT-compatible format.| Field | Value |
|---|---|
| Precision | BF16 |
| Quantization | None |
| Context length | 8192 |
| Max trainer steps | 300 micro-batch steps |
| Micro batch size | 1 |
| Gradient accumulation | 8 |
| Approx optimizer updates | 37 |
| Learning rate | 1e-4 |
| Scheduler | None |
| Max grad norm | 1.0 |
| LoRA rank | 32 |
| LoRA alpha | 64 |
| LoRA dropout | 0.05 |
| LoRA targets | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Checkpoints | 100, 200, 300, best_adapter, final_adapter |
| Final eval loss | 0.1476329118013382 |
| Evaluation | Runtime | Strict pass |
|---|---|---|
| Mobile300 | SGLang | 135 / 300 |
| Mobile300 | Fireworks | 134 / 300 |
| standard60, 3 trials | Fireworks | 25 / 180 |
| Artifact | Link |
|---|---|
| Source teacher trajectories | HF dataset folder |
| Training artifacts | HF dataset folder |
| Fireworks Mobile300 eval | HF dataset folder |
| Fireworks standard60 eval | HF dataset folder |
| Reproduction report | GitHub report |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_id = "Qwen/Qwen3.5-9B"
5adapter_id = "benchflow/benchflow-qwen35-9b"
6
7tokenizer = AutoTokenizer.from_pretrained(base_id, trust_remote_code=True)
8base_model = AutoModelForCausalLM.from_pretrained(
9 base_id,
10 torch_dtype="auto",
11 device_map="auto",
12 trust_remote_code=True,
13)
14model = PeftModel.from_pretrained(base_model, adapter_id)