Views
No views yet
agent_eval_api/ with the top-level 10-benchmark runners and bundled code for APTBench, VLMEvalKit, thinking-in-space, BFCL, and local task configsAgentBench/ code/config needed for DBBenchlm-evaluation-harness/ for ARC, RULER, HH-RLHF, and AdvBenchenv.example.sh with cluster-specific path placeholdershf_cache/, LMUData/, downloaded benchmark datamanual_runs/, runs/, automation*/, score/, or BFCL result/AgentBench/data/ and other benchmark payload dataportable_10bench_eval_bundle_20260330_0140/
README.md
env.example.sh
agent_eval_api/
AgentBench/
lm-evaluation-harness/vllm env: model servingvsibench env: VSI-Bench and current VLMEvalKit wrappersBFCL env: BFCL1cd portable_10bench_eval_bundle_20260330_0140
2source env.example.shenv.example.sh to match the new cluster.--tokenizer / --model inputs.SNAPSHOT_R5=/path/to/round5_snapshotSNAPSHOT_R102025=/path/to/round10_15_20_25_snapshotMMBench, VideoMME, and VSI-Bench expect a shared cache root./path/to/hf_cache, then export:export FIXED_HF_CACHE=/path/to/hf_cache$FIXED_HF_CACHE$FIXED_HF_CACHE/hub$FIXED_HF_CACHE/datasets$FIXED_HF_CACHE/LMUData for MMBenchDBBench uses docker compose via AgentBench/extra/docker-compose.yml.1cd portable_10bench_eval_bundle_20260330_0140/agent_eval_api
2
3bash ./run_all_10bench_db_api.sh \
4 --api-base http://127.0.0.1:8100/v1 \
5 --model your_served_model_name \
6 --tokenizer /path/to/local/model_or_tokenizer \
7 --full \
8 --canonical-hf-home "$FIXED_HF_CACHE" \
9 --canonical-vlmeval-cache "$FIXED_HF_CACHE" \
10 --vsibench-python "$VSIBENCH_PYTHON" \
11 --vlmeval-python "$VLMEVAL_PYTHON" \
12 --bfcl-python "$BFCL_PYTHON" \
13 --base-python "$BASE_PYTHON" \
14 --aptbench-python "$APTBENCH_PYTHON" \
15 --dbbench-python "$DBBENCH_PYTHON" \
16 --output-root ./manual_runs/your_model_run/benchmarks \
17 --tag your_model_runarc, ruler, hh_rlhf, or advbench:1cd portable_10bench_eval_bundle_20260330_0140/agent_eval_api
2
3bash ./run_eval_task_api.sh arc \
4 --api-base http://127.0.0.1:8100/v1 \
5 --model your_served_model_name \
6 --tokenizer /path/to/local/model_or_tokenizer \
7 --lm-eval-dir ../lm-evaluation-harness \
8 --include-path ./tasks \
9 --fullMMBench: agent_eval_api/run_mmbench_api.shVideoMME: agent_eval_api/run_videomme_api.shVSI-Bench: agent_eval_api/run_vsibench_api.shAPTBench: agent_eval_api/run_aptbench_api.shVideoMME infer mode:1cd portable_10bench_eval_bundle_20260330_0140/agent_eval_api
2
3bash ./run_videomme_api.sh \
4 --api-base http://127.0.0.1:8100/v1 \
5 --model your_served_model_name \
6 --model-alias your_served_model_name \
7 --run-mode infer \
8 --api-nproc 4 \
9 --hf-home "$FIXED_HF_CACHE" \
10 --hf-hub-cache "$FIXED_HF_CACHE/hub" \
11 --hf-datasets-cache "$FIXED_HF_CACHE/datasets" \
12 --output-root ./manual_runs/videomme_your_model1export SNAPSHOT_R5=/path/to/round5_snapshot
2export SNAPSHOT_R102025=/path/to/round10_15_20_25_snapshot
3export FIXED_HF_CACHE=/path/to/hf_cache
4export VSIBENCH_PYTHON=/path/to/envs/vsibench/bin/python
5export VLMEVAL_PYTHON=/path/to/envs/vlmeval/bin/python
6export BFCL_PYTHON=/path/to/envs/BFCL/bin/python
7export VLLM_PYTHON=/path/to/envs/vllm/bin/python1cd portable_10bench_eval_bundle_20260330_0140/agent_eval_api
2bash ./run_rounds_from_bfcl_parallel.shARC, RULER, HH-RLHF, AdvBench
lm-evaluation-harness plus local task configs under agent_eval_api/tasks/BFCL
agent_eval_api/gorilla/berkeley-function-call-leaderboard/MMBench, VideoMME
VLMEvalKit; these wrappers are often used in infer mode for leaderboard submission workflowsVSI-Bench
thinking-in-space integration and lmms_eval in the chosen Python envAPTBench
agent_eval_api/APTBench/code/DBBench
AgentBench/ code and Docker services1cd portable_10bench_eval_bundle_20260330_0140/agent_eval_api
2
3bash -n run_all_10bench_db_api.sh
4bash -n run_eval_task_api.sh
5bash -n run_mmbench_api.sh
6bash -n run_videomme_api.sh
7bash -n run_vsibench_api.sh
8bash -n run_aptbench_api.sh
9
10curl -fsS http://127.0.0.1:8100/v1/models