Views
No views yet
| Stage | Judge Score | vs Baseline |
|---|---|---|
| Baseline (no fine-tuning) | 5.93/10 | — |
| Best SFT (T1) | 6.40/10 | +7.9% |
| Best GRPO (G1) ← this model | 7.03/10 | +18.6% |
1from peft import AutoPeftModelForCausalLM
2from transformers import AutoTokenizer
3
4model = AutoPeftModelForCausalLM.from_pretrained("ZalzalaKhan/Qwen2.5-0.5B-GSM8K-GRPO")
5tokenizer = AutoTokenizer.from_pretrained("ZalzalaKhan/Qwen2.5-0.5B-GSM8K-GRPO")
6
7messages = [
8 {"role": "system", "content": "Reason step by step and clearly provide the final numerical answer."},
9 {"role": "user", "content": "Janet has 10 apples. She gives 3 to her friend. How many does she have left?"}
10]
11
12input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True)
13output = model.generate(input_ids, max_new_tokens=256, temperature=0.6, top_p=0.95)
14print(tokenizer.decode(output[0], skip_special_tokens=True))| Parameter | Value |
|---|---|
| Base model | SFT T1 checkpoint |
| LoRA Rank | 32 |
| Target Modules | q_proj, v_proj |
| KL Coefficient | 0.1 |
| Learning Rate | 1e-5 |
| Group Size | 8 |
| Generation Temp | 0.6 |
| Train Samples | 500 (GSM8K) |
| Training Time | 162 min (Kaggle T4) |