Compact agent evaluation benchmark with 104 tasks created by ClawEnvKit.
huggingface-cli download AIcell/Auto-ClawEval-mini --repo-type dataset --local-dir Auto-ClawEval-mini
bash run_harnesses.sh --harness claudecode --dataset Auto-ClawEval-mini… See the full description on the dataset page:
https://huggingface.co/datasets/AIcell/Auto-ClawEval-mini.