Views
No views yet
vllm serve jiulaikankan/CAPF-Qwen3-4B-Thinking-Search \
--port 8009 \
--served-model-name qwen3 \
--async-scheduling \
--data-parallel-size 1 \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.9 \
--enable-auto-tool-choice --tool-call-parser hermes \
--reasoning-parser deepseek_r1 \
--max-num-seqs 100 \
--enforce-eager