Views
No views yet
| Base model | Qwen/Qwen3.6-35B-A3B |
| Method | LoRA (rank 8, alpha 32) + importance-sampling GRPO, async off-policy |
| Stack | Tinker + tinker-cookbook |
| Steps | 34 outer-loop steps (pilot-7 → pilot-7b, warm-started) |
| Reward | validation efficiency + job quality (absolute post-training score + uplift over the best untrained baseline) + a small train-speed tie-breaker |
| Sampling during training | temperature 1.0, Qwen3.5 renderer / chat template |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained(
5 "Qwen/Qwen3.6-35B-A3B", torch_dtype="auto", device_map="auto"
6)
7model = PeftModel.from_pretrained(base, "Danau5tin/ai-trains-ai-trainer")
8tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3.6-35B-A3B")--enable-lora --lora-modules trainer=<path>). For real episodes, drive it through the harness in the GitHub repo.evals/), so post-release comparisons of new models against this adapter on those files are contaminated by definition.