The dataset used in paper: Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
There are four files:
train_polaris.parquet: Training data for RL with RRM.
test_polaris.parquet: Test data for RL with RRM.
train_rrm.parquet: Training data for RRM.
test_rrm.parquet: Test data for RRM.