Views
No views yet
transformers.generate), and
headroom + run-length govern the gain. Full teardown in the repo.use_vllm colocate), LoRA r=16 / alpha=32, group size 8, beta 0, correctness + format
reward, 400 steps, 1x A100.1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
4model = PeftModel.from_pretrained(base, "yavuz-ai/qwen2.5-1.5b-grpo-gsm8k")
5tok = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")