Views
No views yet
NewBeeKing/MemPO_Qwen2.5-SFT-RLNewBeeKing/MemPO_Qwen2.5-SFT, trained using the MemPO algorithm on the NewBeeKing/MemPO_RL-train-dataset.NewBeeKing/MemPO_Qwen2.5-SFTNewBeeKing/MemPO_RL-train-dataset1@misc{li2025mempo,
2 title={MemPO: Self-Memory Policy Optimization for Long-Horizon Agents},
3 author={Ruoran Li and Xinghua Zhang and Haiyang Yu and Shitong Duan and Xiang Li and Wenxin Xiang and Chonghua Liao and Xudong Guo and Yongbin Li and Jinli Suo},
4 year={2025},
5 eprint={2603.00680},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG},
8 url={https://arxiv.org/abs/2603.00680},
9}