Views
No views yet
| Setting | PRO-STEP PRM | VersaPRM | Math-PRM | Majority Voting |
|---|---|---|---|---|
| HotpotQA WMV-min | 59.50 ★ | 53.58 | 53.90 | 54.07 |
| HotpotQA BoN-min | 59.07 ★ | 53.26 | 48.07 | 54.07 |
| PopQA WMV-min | 50.01 ★ | 49.50 | 49.49 | 48.74 |
| PopQA BoN-min | 49.07 ★ | 45.11 | 41.32 | 48.74 |
| 2Wiki WMV-min | 46.01 ★ | 43.40 | 43.49 | 44.00 |
| 2Wiki BoN-min | 43.54 | 27.78 | 34.27 | 44.00 |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_model = AutoModelForCausalLM.from_pretrained("deepseek-ai/DeepSeek-R1-0528-Qwen3-8B", torch_dtype="auto")
5prm = PeftModel.from_pretrained(base_model, "DORAEMONG/PRO-STEP-PRM-8B")
6tokenizer = AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-R1-0528-Qwen3-8B")
7
8# Inference: provide trajectory step, get [REASONING] + Label: 0/1
9# See paper Appendix A for the MCTS scoring prompt1@article{prostep2026,
2 title={PRO-STEP: Step-level Process Reward Optimization for Retrieval-Augmented Generation},
3 author={...},
4 year={2026}
5}