Views
No views yet
Qwen/Qwen3.5-4B-Base, trained with GRPO (Group Relative Policy
Optimization) on GSM8K, using two verifiable rewards:\boxed{...}.| Dataset | Base pass@1 | +GRPO pass@1 |
|---|---|---|
| GSM8K test | 85.4% | 92.4% |
| MATH-500 | 62.2% | 61.6% |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B-Base", torch_dtype="bfloat16")
5model = PeftModel.from_pretrained(base, "praysimanjuntak/qwen3.5-4b-grpo-gsm8k")
6tok = AutoTokenizer.from_pretrained("Qwen/Qwen3.5-4B-Base")Qwen/Qwen3.5-4B-Basetrl.GRPOTrainerr=32, target all-linear