Views
No views yet
max_seq_len (2048) as the 10/90, 15/85 and 20/80 arms — only the difficult-advice share
differs. It isolates what SFT on replay alone does, which a comparison against the base
model cannot.qwen3.6-27b-synthdocv2-mixture-0_100.| Tokens | 995,877 (1,555 conversations) |
| Supervised | 775,839 / 995,877 = 77.9% |
| Epochs / steps | 1 / 98 |
| Runtime | 58 min, 1x H100 80GB |
| r / alpha / dropout | 32 / 64 / 0.05 |
| batch x grad-accum | 1 x 16 |
| lr / schedule | 1e-4, cosine, 3% warmup |
| Final loss | 0.876 |
| Token accuracy | 0.774 |
| Arm | Difficult-advice | Loss | Token acc |
|---|---|---|---|
| 0/100 (this) | 0% | 0.876 | 0.774 |
| 10/90 | 10.0% | 0.901 | 0.811 |
| 15/85 | 15.0% | 0.924 | 0.768 |
| 20/80 | 20.1% | 0.928 | 0.791 |
1from peft import PeftModel
2from transformers import AutoModelForImageTextToText
3
4model = AutoModelForImageTextToText.from_pretrained("Qwen/Qwen3.6-27B", dtype="bfloat16")
5model = PeftModel.from_pretrained(model, "LASR-Callum/2026-08-02-qwen36-synthdoc-package-lora-0-100")
6model = model.merge_and_unload()AutoModelForImageTextToText, not AutoModelForCausalLM — this is a vision-language
checkpoint.