Views
No views yet
bits=4, group_size=128, sym=True) in auto_gptq format.1vllm serve Jon-Nielsen/GLM-4.7-REAP-30-W4A16 \
2 --tensor-parallel-size 2 \
3 --kv-cache-dtype fp8 \
4 --gpu-memory-utilization 0.96 \
5 --max-model-len 196608 \
6 --max-num-seqs 8 \
7 --max-num-batched-tokens 16384 \
8 --trust-remote-code \
9 --enable-prefix-caching \
10 --enable-chunked-prefill \
11 --enable-expert-parallel \
12 --tool-call-parser=glm47 \
13 --reasoning-parser=glm45 \
14 --enable-auto-tool-choice \
15 --disable-custom-all-reduce