Full per-run eval results (results.json with transcripts) for SFT runs evaluated on tau2-bench's banking_knowledge domain.
Each folder is one eval run. SFT'd Qwen / Gemma models from monte-inc are evaluated against this dataset's standard config and the full results.json is mirrored here.
Sibling datasets:
monte-inc/tau2-banking-baselines - non-SFT baselines
monte-inc/tau2-banking-archived - pre-gpt-5.2 (gpt-4.1 user sim) runs, not directly… See the full description on the dataset page:
https://huggingface.co/datasets/monte-inc/tau2-banking-eval-results.