=== DATASET STRUCTURE ===
Unique problems: 100
Orderings per problem: 2 (original + swapped)
Judges per evaluation: 5
Total evaluations: 200
Total judge responses: 1000
Distribution of judge agreement levels:
5-0 unanimous: 92/200 (46.0%)
4-1 strong majority: 3/200 (1.5%)
3-1 narrow majority: 15/200 (7.5%)
3-2 narrow majority: 5/200 (2.5%)
2-1 narrow majority: 24/200 (12.0%)
2-2… See the full description on the dataset page:
https://huggingface.co/datasets/RLAIF/genrm-uf-qwen3-4b-angel-judge-qwen-3-4b-base-jt07-j200-n200-20250729-121827.