Views
No views yet
| Quant | Size | BPW | Description |
|---|---|---|---|
| Q8_0 | 27 GB | 8.50 | Best quality, near-lossless |
| Q6_K | 21 GB | 6.57 | Great quality, good size balance |
| Q4_K_M | 16 GB | 4.92 | Recommended default |
| Q3_K_M | 13 GB | 3.86 | For constrained VRAM |
| File | Size | Type |
|---|---|---|
| mmproj-F16 | 885 MB | F16 |
| Setup | Recommended Quant |
|---|---|
| 1x 48 GB (A6000, RTX 6000 Ada) | Q8_0 |
| 2x 24 GB (RTX 3090/4090) | Q8_0 split across GPUs |
| 1x 24 GB (RTX 3090/4090) | Q6_K |
| 2x 16 GB (RTX 4060 Ti) | Q4_K_M or Q6_K split |
| 1x 16 GB (RTX 4060 Ti) | Q3_K_M |
VRAM usage = text model + mmproj (885 MB) + KV cache (varies with context length). Leave at least 2-4 GB headroom for KV cache and overhead.
1# Text-only
2llama-cli -m Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-Q4_K_M.gguf -p "Hello!"
3
4# With vision (image input)
5llama-mtmd-cli \
6 -m Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-Q4_K_M.gguf \
7 --mmproj Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-mmproj-F16.gguf \
8 --image photo.jpg \
9 -p "Describe this image."1llama-server \
2 -m Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-Q4_K_M.gguf \
3 --mmproj Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-mmproj-F16.gguf \
4 --port 80801# Example: 2x 24GB GPUs
2llama-server \
3 -m Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-Q8_0.gguf \
4 --mmproj Huihui-Qwen3.5-27B-abliterated-Athanorlite-ORPO-v2-mmproj-F16.gguf \
5 -ngl 99 --tensor-split 1,1