Private trajectory snapshots for evaluating Maka, Codex, Claude Code, and future
agent harnesses under shared benchmark conditions.
Terminal-Bench 2.1:
model: DeepSeek V4 Flash
reasoning effort: max
arms: Maka, Codex, Claude Code
run ID: deepseek-three-way-v2
latest snapshot: latest.json
DeepSWE 1.1 full:
model: DeepSeek V4 Flash
reasoning effort: max
arms: Maka, OpenCode
run ID:… See the full description on the dataset page:
https://huggingface.co/datasets/hqeric/maka-eval-trajectories.