Comprehensive AIME 2025 prompt evaluation results from GEPA (Genetic-Pareto) prompt optimization experiments.
Each prompt was evaluated on the full 150-example AIME 2025 test set (MathArena/aime_2025 x5) with 10 samples per problem using openai/gpt-4.1-mini at temperature 0.7.