Views
No views yet
unsloth/Qwen3-4B-Instruct-2507, trained for agentic code repair on the local SWE-Gym moto held-out investigation using a search/replace patch format and honest anchored retrieval./mnt/disks/unslothai/datta0/cache/qwen3-grpo-patch/20260605_005347_swegym_q4b-kl02-multihint-grpo-b02-lr2e6-s25_c1a36f8/checkpoints/checkpoint-25unsloth/Qwen3-4B-Instruct-2507imdatta0/qwen3-4b-swegym-moto-kl02-adapter0.022e-625| run | greedy | mean reward | patch applied |
|---|---|---|---|
| KL02 + prompt hint, step 0 baseline | 9/35 | 0.4563 | 0.8571 |
| GRPO continuation, step 25 | 8/35 | 0.4234 | 0.8286 |
imdatta0/qwen3-4b-swegym-moto-kl02-adapter1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = "unsloth/Qwen3-4B-Instruct-2507"
5adapter = "imdatta0/qwen3-4b-swegym-moto-kl02-multihint-grpo-b02-lr2e6-s25-adapter"
6
7tokenizer = AutoTokenizer.from_pretrained(adapter)
8model = AutoModelForCausalLM.from_pretrained(base)
9model = PeftModel.from_pretrained(model, adapter)