Full per-run eval results for pre-gpt-5.2 era tau2-bench runs (gpt-4.1 user simulator, often other config drift).
Not directly comparable to current numbers in monte-inc/tau2-banking-eval-results and monte-inc/tau2-banking-baselines, which all use gpt-5.2.
Kept here as a historical record (Gemma 4 MoE went from 11.4% on gpt-4.1 -> 13.9% on gpt-5.2 - same model, ~2.5pp swing from user-sim alone).