1python3 -m vllm.entrypoints.openai.api_server \
2 --port <port> --model yejingfu/Meta-Llama-3.1-8B-Instruct-FP8-128K \
3 --tensor-parallel-size 1 --swap-space 16 --gpu-memory-utilization 0.96 \
4 --max-num-seqs 32 --max-model-len 131072 --kv-cache-dtype fp8 --enable-chunked-prefill