Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
MATH500
GPQADiamond
CodeElo
MMLUPro
JEEBench
LiveCodeBenchv5
LiveCodeBench
AIME25
AIME24
AMC23
HLE
Average Accuracy: 34.5% ± 0.4%… See the full description on the dataset page:
https://huggingface.co/datasets/mlfoundations-dev/gpt-4.1-2025-04-14_eval_68b3.