Views
No views yet
Qwen3_5ForConditionalGeneration architecture used by Qwen/Qwen3.5-4B.1tar -xzf vllm-wheel-linux-x86_64.tar.gz
2python -m pip install --no-index --no-deps --force-reinstall \
3 ./vllm-0.23.1rc1.dev102+ga46abb7ae-cp38-abi3-manylinux_2_28_x86_64.whl
4python -c "import vllm; print(vllm.__version__)"1CUDA_VISIBLE_DEVICES=1,2 vllm serve /cm/archive/tue09/model_hub/Qwen/Qwen3.5-4B \
2 --port 8000 \
3 --served-model-name Qwen/Qwen3.5-4B \
4 --tensor-parallel-size 2 \
5 --max-model-len 8192 \
6 --reasoning-parser qwen3 \
7 --language-model-only