Views
No views yet
| Model | GSM8K Test Accuracy |
|---|---|
| Base (Qwen2.5-1.5B-Instruct) | 0.0%* |
| + GRPO 100 steps | 29.2% |
<answer> tags without training.1from unsloth import FastLanguageModel
2from peft import PeftModel
3
4model, tokenizer = FastLanguageModel.from_pretrained(
5 "Qwen/Qwen2.5-1.5B-Instruct", load_in_4bit=True
6)
7model = PeftModel.from_pretrained(model, "shiva-sankeerth/qwen2.5-1.5b-grpo-gsm8k")<reasoning>
step-by-step working...
</reasoning>
<answer>
42
</answer>