Views
No views yet
NVFP4A16 (W4A16, group size 16), exported as compressed-tensors (nvfp4-pack-quantized).Linear layers (Qwen3_5ForConditionalGeneration)lm_head, vision tower, GDN linear_attn internals, norms, embeddings1vllm serve logicauro/Qwen3.8-27B-Dominatrix-NVFP4A16 \
2 --served-model-name Qwen3.8-27B-Dominatrix \
3 --language-model-only \
4 --quantization compressed-tensors \
5 --kv-cache-dtype fp8 \
6 --max-model-len 98304 \
7 --max-num-seqs 1 \
8 --reasoning-parser qwen3 \
9 --chat-template chat_template.jinja \
10 --trust-remote-codemin_p 0.1 or top_p 0.95. Chat-template defaults: preserve_thinking off, reasoning_effort medium.