Views
No views yet
| Metric | Original FP16 | W8A8 Quantized (This Model) |
|---|---|---|
| Model Size | ~9.5 GB | ~4.75 GB |
| Memory Usage | ~10-12 GB GPU | ~5 GB GPU |
| Inference Speed | 1x (baseline) | 1.5-2x faster |
| Audio Quality | 100% (baseline) | >98% similar |
| Compatibility | Standard PyTorch/Unsloth | vLLM, llmcompressor |
1docker run \
2--runtime nvidia \
3--gpus all \
4-v ~/.cache/huggingface:/root/.cache/huggingface \
5-v ~/.cache/vllm:/root/.cache/vllm \
6-v ~/snor-quant:/models \
7-p 8002:8002 \
8--env "HF_HUB_ENABLE_HF_TRANSFER=1" \
9--env "HUGGING_FACE_HUB_TOKEN=${HUGGING_FACE_HUB_TOKEN}" \
10--env "HF_HUB_OFFLINE=1" \
11--ipc=host \
12--shm-size 32g \
13--log-opt max-size=10m \
14--log-opt max-file=3 \
15vllm/vllm-openai:latest \
16--port 8002 \
17--model "/models/snorTTS-Indic-v0-W8A8-Conservative" \
18--served-model-name llm \
19--host 0.0.0.0 \
20--max-model-len 2048 \
21--max-num-seqs 5 \
22--gpu-memory-utilization 0.25 \
23--dtype auto \
24--quantization compressed-tensors \
25--uvicorn-log-level info