Views
No views yet
1/T.1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = "Qwen/Qwen3-1.7B"
5model = AutoModelForCausalLM.from_pretrained(base, torch_dtype="bfloat16", device_map="auto")
6model = PeftModel.from_pretrained(model, "<org>/DASH-Qwen3-1.7B-LoRA")
7tok = AutoTokenizer.from_pretrained("<org>/DASH-Qwen3-1.7B-LoRA")
8
9msgs = [{"role": "user", "content": "Find the number of ordered pairs..."}]
10text = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True, enable_thinking=True)
11out = model.generate(**tok(text, return_tensors="pt").to(model.device), max_new_tokens=38912,
12 do_sample=True, temperature=1.0, top_p=1.0)
13print(tok.decode(out[0], skip_special_tokens=True))model = model.merge_and_unload().| LoRA | r=64, alpha=128, dropout=0.05, on q/k/v/o/gate/up/down projections |
| Optimizer | AdamW, lr 5e-6, linear decay, no warmup, max_grad_norm 0.1 |
| Global batch | 64 |
| Divergence | full-vocabulary forward KL, per-element clip tau=0.05 |
| Gate sharpness | kappa = 5 |
| Rollout | temperature 1.1, top_p 0.95, top_k 20, max 1024 tokens |
| Precision | bf16, DeepSpeed ZeRO-2 |
1@inproceedings{TODO_key,
2 title = {DASH: Divergence-Adaptive Supervision Horizons for On-Policy
3 Self-Distillation of Reasoning Models},
4 author = {TODO},
5 year = {2027}
6}