Views
No views yet
| Model | Harness | SWE-Bench-Verified-100 | OpenThoughts-TBLite | Terminal-Bench 2.0 |
|---|---|---|---|---|
| Qwen/Qwen3-32B | Terminus-2 | 26.7 | 13.7 | 7.5 |
| OpenThinkerAgent-32B | Terminus-2 | 55.7 | 41.3 | 26.2 |
| Benchmark | Accuracy |
|---|---|
| SWE-Bench-Verified | 54.0 |
| Terminal-Bench 2.0 | 26.2 |
| Aider-Polyglot | 32.4 |
| BFCL-Parity | 85.9 |
| MedAgentBench | 47.8 |
| GAIA-127 | 23.6 |
| FinanceAgent-Terminal | 44.0 |
| Average (7) | 44.8 |
@misc{openthoughts-agent,
author = {Team, OpenThoughts-Agent},
title = {{OpenThoughts-Agent: Data Recipes for Agentic Models}},
howpublished = {https://www.openthoughts.ai/blog/agent},
year = {2026}
}