Views
No views yet
| Metric | Causal (EXP-010) | Baseline (this model) |
|---|---|---|
| Mean reward | 0.394 | 0.255 |
| Peak reward | 0.560 | 0.400 |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-Math-7B-Instruct")
5model = PeftModel.from_pretrained(base, "resonancetech/qwen2.5-math-7b-baseline-grpo")
6tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-Math-7B-Instruct")