Views
No views yet
model-multimodal-extra.safetensors file so that Qwen3_5ForConditionalGeneration behavior is preserved.huihui-ai/Huihui-Qwen3.5-27B-Claude-4.6-Opus-abliteratedllmcompressor one-shot NVFP4neuralmagic/calibration (LLM split)5122048Linearlm_headmodel.visual.* linear layerslinear_attn.in_proj_alinear_attn.in_proj_bmodel-00001-of-00005.safetensors to model-00005-of-00005.safetensors
model-multimodal-extra.safetensors
model.safetensors.index.json
processor_config.json
recipe.yaml
total_parameters: 16713682960total_size: 19743450720hybrid_extra_tensor_count: 333hybrid_extra_tensor_bytes: 921460192vllm/vllm-openai:cu130-nightly0.17.2rc1.dev153+g39474513fVLLM_NVFP4_GEMM_BACKEND=marlinPOST /v1/chat/completions
message.reasoningmessage.content if max_tokens is large enoughPOST /v1/responses
output[].type = "reasoning"output[].type = "message" and content[].type = "output_text"responses output instead of assuming the top-level text field is populated.1vllm serve /path/to/Huihui-Qwen3.5-27B-Claude-4.6-Opus-abliterated-NVFP4 \
2 --reasoning-parser qwen3 \
3 --enable-auto-tool-choice \
4 --tool-call-parser qwen3_coder \
5 --gpu-memory-utilization 0.95 \
6 --kv-cache-dtype fp8