Views
No views yet
| Variant | MMLU-Pro | GPQA | AIME 2025 |
|---|---|---|---|
| Unsloth NVFP4 Fast | 85.58 | 87.75 | 91.67 |
| Unsloth NVFP4 | 85.85 | 86.74 | 92.29 |
| NVIDIA NVFP4 | 85.60 | 87.12 | 91.88 |
| BF16 | 85.75 | 86.36 | 92.50 |
| File | Size | Description |
|---|---|---|
qwen36-35b-a3b-fast-nvfp4.gguf | ~18.8 GB | NVFP4 quantized text model |
mmproj-qwen36-35b-a3b-f16.gguf | ~0.84 GB | Vision encoder (F16) |
1llama-server \
2 -m qwen36-35b-a3b-fast-nvfp4.gguf \
3 --mmproj mmproj-qwen36-35b-a3b-f16.gguf \
4 -ngl 99 \
5 --host 0.0.0.0 \
6 --port 80801pip install vllm flashinfer-python nvidia-cutlass-dsl
2vllm serve FreedomAISVR/Qwen3.6-35B-A3B-NVFP4-Fast-GGUF --dtype auto --max-model-len 4096llama-quantize.exe NVFP4).