Views
No views yet
google/gemma-3-4b-it.adapter_model.safetensors: LoRA adapter weightsadapter_config.json: PEFT adapter configuration1PORT=8071
2GPU=0
3MODEL_ID=google/gemma-3-4b-it
4SERVED_MODEL_NAME=gemma3_with_reasoning
5ADAPTER_REPO=sscollab2/gemma3_checkpoint_step100
6
7CUDA_VISIBLE_DEVICES="$GPU" vllm serve "$MODEL_ID" \
8 --host 0.0.0.0 \
9 --port "$PORT" \
10 --tensor-parallel-size 1 \
11 --gpu-memory-utilization 0.90 \
12 --max-model-len 32768 \
13 --served-model-name gemma3_base \
14 --enable-lora \
15 --lora-modules "${SERVED_MODEL_NAME}=${ADAPTER_REPO}" \
16 --max-lora-rank 16 \
17 --enable-auto-tool-choice \
18 --tool-call-parser hermes \
19 --limit-mm-per-prompt '{"image":10,"audio":0}'1curl http://127.0.0.1:8071/v1/chat/completions \
2 -H "Content-Type: application/json" \
3 -d '{
4 "model": "gemma3_with_reasoning",
5 "messages": [
6 {"role": "user", "content": "Hello!"}
7 ]
8 }'/local3/elaine1wan/SS_inference/SS_inference_0507/gemma3_scripts/run_serve_gemma3_checkpoint.sh