Views
No views yet
1vllm serve vastai-ais/Qwen3-0.6B-GPTQ-INT4 \
2--tensor-parallel-size 1 \
3--max-model-len 65536 \
4--reasoning-parser deepseek_r1 \
5--served-model-name qwen1curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d ' {
2 "model": "qwen",
3 "messages": [
4 {"role": "system", "content": "You are a helpful assistant."},
5 {"role": "user", "content": "Who are you?"}
6 ],
7 "max_tokens": 512
8 } '