Auto-generated agent evaluation benchmark with 1,040 tasks across 104 unique scenarios created by ClawEnvKit.
huggingface-cli download AIcell/Auto-ClawEval --repo-type dataset --local-dir Auto-ClawEval
bash run_harnesses.sh --harness claudecode… See the full description on the dataset page:
https://huggingface.co/datasets/AIcell/Auto-ClawEval.