Views
No views yet


1uv venv --python 3.12 --seed --managed-python
2source .venv/bin/activate
3git clone https://github.com/vllm-project/vllm.git
4cd vllm
5uv pip install --editable . --torch-backend=auto1# Switch to trtllm backend to work-around mnnvl workspace size issue.
2export VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm
3vllm serve AngelSlim/Hy3-GPTQ-Int4 \
4 --tensor-parallel-size 8 \
5 --speculative-config.method mtp \
6 --speculative-config.num_speculative_tokens 2 \
7 --tool-call-parser hy_v3 \
8 --reasoning-parser hy_v3 \
9 --enable-auto-tool-choice \
10 --port 8000 \
11 --served-model-name hy3-gptq-int4