Views
No views yet
vllm serve Qwen/Qwen3-32B
--compilation-config {"cudagraph_specialize_lora": "False"} \
--max_num_seqs 64 \
--quantization bitsandbytes \
--max_model_len 2048 \
--gpu_memory_utilization 0.85 \
--enable-lora --lora-modules dadjokes=<path to adapter dir>