Views
No views yet
| Detail | Value |
|---|---|
| Method | NVFP4 (compressed-tensors) |
| Model size | ~23 GB (vs 67 GB BF16) |
| Language model | NVFP4 quantized |
| Visual encoder | BF16 (unquantized, 333 tensors, 0.89 GB) |
| Excluded from quantization | lm_head, MoE gates, shared expert gates, linear attention layers, visual encoder |
train_sft split) — length-filtered (longest conversations selected)chat split)moe_calibrate_all_experts=True1vllm serve Li101/Qwen3.5-35B-A3B-Uncensored-Aggressive-NVFP4 \
2 --kv-cache-dtype fp8 \
3 --reasoning-parser qwen3 \
4 --enable-auto-tool-choice \
5 --tool-call-parser qwen3_coder