See
https://github.com/allenai/reward-bench for more details
Built with the rewardbench CLI tool.
Accuracy: 0.455
Command used to run:
python /scratch/yl13579/.conda/envs/rewardbench/bin/rewardbench --model=sfairXC/FsfairX-LLaMA3-RM-v0.1 --dataset=Yuhan123/eval_data_oasst1_1k_en_their --split=train --chat_template=raw --batch_size=128 --push_results_to_hub --upload_model_metadata_to_hf