Views
No views yet
| Evaluation | Metric | Result |
|---|---|---|
| General-reasoning OOD suite | Macro average | 52.75 |
| ALFWorld | SR | 16.12 ± 2.87 |
| WebShop | Score | 42.01 ± 2.14 |
| WebShop | SR | 1.33 ± 0.76 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "nics-efc/VPR-Qwen3-4B-Base-Math-Mixed"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(
6 model_id,
7 torch_dtype="auto",
8 device_map="auto",
9)
10
11inputs = tokenizer("Solve the task step by step.", return_tensors="pt").to(model.device)
12outputs = model.generate(**inputs, max_new_tokens=1024)
13print(tokenizer.decode(outputs[0], skip_special_tokens=True))1@misc{yuan2026verifiable,
2 title = {Verifiable Process Rewards for Agentic Reasoning},
3 author = {Huining Yuan and Zelai Xu and Huaijie Wang and Xiangmin Yi and Jiaxuan Gao and Xiao-Ping Zhang and Yu Wang and Chao Yu and Yi Wu},
4 year = {2026},
5 eprint = {2605.10325},
6 archivePrefix = {arXiv},
7 primaryClass = {cs.AI},
8 url = {https://arxiv.org/abs/2605.10325}
9}