Views
No views yet
1@article{su2025trust,
2 title={Trust region preference approximation: A simple and stable reinforcement learning algorithm for llm reasoning},
3 author={Su, Xuerui and Xie, Shufang and Liu, Guoqing and Xia, Yingce and Luo, Renqian and Jin, Peiran and Ma, Zhiming and Wang, Yue and Wang, Zun and Liu, Yuting},
4 journal={arXiv preprint arXiv:2504.04524},
5 year={2025}
6}