UniReward is a large-scale multi-dimensional reward modeling dataset designed for multimodal moderation under realistic data sparsity.
It is introduced in:
From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation (2026)
UniReward supports training multi-head scalar reward models under a Single-Sample Single-Label (SSSL) setting.
Total… See the full description on the dataset page:
https://huggingface.co/datasets/Carol0110/UniReward.