Views
No views yet
transformers
Qwen3ForCausalLM.| Base model | Qwen/Qwen3-4B-Base (~4.0B params) |
| SFT data | allenai/Dolci-Instruct-SFT (~2.15M examples) |
| Epochs | ~2.03 (34,000 steps) |
| Global batch size | 128 |
| Max sequence length | 4096 |
| Optimizer | AdamW (weight_decay=0.0), grad-norm clip 1.0 |
| LR schedule | peak 2e-6, cosine decay to 0, 500 warmup steps |
| Loss | assistant-only (prompt/system/tool tokens masked) |
| Hardware | v6e-64 (FSDP=64) TPU |
enable_thinking=False. IFEval / IFBench report
strict instruction-level accuracy; GSM8K / MATH-500 report accuracy; Multi-IF
is the mean of turn_{1,2,3} strict instruction-level; MultiChallenge is the
overall score (GPT-4o judge).| Model | IFEval | IFBench | GSM8K | MATH-500 | Multi-IF | MultiChallenge |
|---|---|---|---|---|---|---|
| Qwen3-4B-SFT-Dolci (this model) | 83.81 | 20.64 | 89.69 | 68.80 | 61.78 | 16.06 |
| Qwen3-8B-SFT-Dolci | 84.29 | 22.67 | 91.36 | 73.00 | 61.71 | 15.41 |
| Qwen3-14B-SFT-Dolci | 84.17 | 26.45 | 94.24 | 74.40 | 66.61 | 15.30 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4repo = "yxli2123/Qwen3-4B-SFT-Dolci"
5tok = AutoTokenizer.from_pretrained(repo)
6model = AutoModelForCausalLM.from_pretrained(repo, dtype=torch.bfloat16, device_map="auto")
7
8messages = [{"role": "user", "content": "Give me three tips for writing clear code."}]
9ids = tok.apply_chat_template(messages, add_generation_prompt=True,
10 enable_thinking=False, return_tensors="pt").to(model.device)
11out = model.generate(ids, max_new_tokens=256)
12print(tok.decode(out[0][ids.shape[-1]:], skip_special_tokens=True))