Views
No views yet
sym): Truensamples): 512iters): 600quant_nontext_module): False (Kept in BF16 to preserve visual reasoning and OCR precision)layer_config): Multi-Token Prediction (mtp, mtp.fc) layers preserved in native bfloat16.1vllm serve Vishva007/Qwen3.8-27B-W4A16-AutoRound \
2 --quantization auto-round \
3 --dtype bfloat16 \
4 --max-model-len 4096 \
5 --gpu-memory-utilization 0.90
6--quantization gptq if required by your backend).🎁 Need GPU compute? Sign up via RunPod and get $5–$500 in free credits when you add your first $10.
| Template | CUDA Version | Docker Image | Template ID | Deploy |
|---|---|---|---|---|
| PyTorch 2.13 (CUDA 12.6) | 12.6 | vishva123/cuda-12.6-pytorch-2.13-runpod | gmlupxnxfk | |
| PyTorch 2.13 (CUDA 13.0) | 13.0 | vishva123/cuda-13.0-pytorch-2.13-runpod | y3j8xvk4f4 | |
| PyTorch 2.13 (CUDA 13.2) | 13.2 | vishva123/cuda-13.2-pytorch-2.13-runpod | vigpissn5w |
| Template | CUDA Version | Docker Image | Template ID | Deploy |
|---|---|---|---|---|
| PyTorch 2.12 (CUDA 12.6) | 12.6 | vishva123/cuda-12.6-pytorch-2.12-runpod | ctmz86zmf0 | |
| PyTorch 2.12 (CUDA 13.0) | 13.0 | vishva123/cuda-13.0-pytorch-2.12-runpod | qjko5yiwzi | |
| PyTorch 2.12 (CUDA 13.2) | 13.2 | vishva123/cuda-13.2-pytorch-2.12-runpod | ifg6xmye0f |