Question-level subsets built from haowu89/math-ai-bench-sources-final.
Each row keeps one benchmark question and 8 selected reasoning trajectories.
Fields:
problem, original_solution, answer, source, index
model: mixed quality bucket identifier
generated_solutions: 8 selected trajectories
count: always 8
context_metadata: token counts, correctness labels, selected source models, and selected trajectory indices