Views
No views yet
llama.cpp and are optimized for local inference on consumer hardware.| Filename | Quant Type | Size | Description |
|---|---|---|---|
| gemma-4-26B-IQ4_NL.gguf | IQ4_NL | ~14.6 GB | Recommended. High quality 4-bit, best balance of intelligence and size. |
| gemma-4-26B-Q6_K.gguf | Q6_K | ~22.9 GB | Near-lossless. Requires 24GB+ VRAM for full GPU offload. |
| gemma-4-26B-Q4_K_M.gguf | Q4_K_M | ~16.9 GB | Standard balanced quant. High compatibility. |
| gemma-4-26B-Q3_K_M.gguf | Q3_K_M | ~12.5 GB | Good for 12GB VRAM cards or high-context usage. |
| gemma-4-26B-Q2_K.gguf | Q2_K | ~10.5 GB | Maximum compression. Usable for basic logic and data retrieval. |
llama-cli -m gemma-4-26B-IQ4_NL.gguf -ngl 99 -c 8000 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --reasoning-budget 4096