Views
No views yet
| File | Size | Description |
|---|---|---|
gemma-4-26B-A4B-it.Q3_K_S.gguf | 12.2 GB | Q3_K_S — fits in 16GB VRAM |
gemma-4-26B-A4B-it.BF16-mmproj.gguf | ~1.2 GB | Vision encoder (required for multimodal) |
1llama-server \
2 --model gemma-4-26B-A4B-it.Q3_K_S.gguf \
3 --mmproj gemma-4-26B-A4B-it.BF16-mmproj.gguf \
4 --port 8080 \
5 --n-gpu-layers 99 \
6 --ctx-size 32768 \
7 --flash-attn on \
8 --cache-type-k q4_0 \
9 --cache-type-v q4_0<think> / answer formatting