UniRM is a
multi-head scalar reward model that provides
interpretable, attribute-level scoring for multimodal moderation. It was introduced in the paper
From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation.
1git clone https://github.com/TideDra/lmm-r1.git
2cd lmm-r1
3pip install -e .[vllm]
4pip install flash_attn --no-build-isolation
5python unirm.py --model_path {PATH_TO_UNIRM}
1@misc{gu2026sparsedecisionsdensereasoning,
2 title={From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation},
3 author={Tianle Gu and Kexin Huang and Lingyu Li and Ruilin Luo and Shiyang Huang and Zongqi Wang and Yujiu Yang and Yan Teng and Yingchun Wang},
4 year={2026},
5 eprint={2602.02536},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG},
8 url={https://arxiv.org/abs/2602.02536},
9}