Views
No views yet
general.architecture = gemma4_mtpllama.cpp, which does not currently support
Gemma 4 MTP the same way as ik_llama.cpp.| File | Quant | Size | SHA256 |
|---|---|---|---|
gemma-4-26B-A4B-it-assistant-Q6_K.gguf | Q6_K | 344 MiB | 49e59e9e0e097f97751d08b9bd00edf3bd2316b188bd129bd5098eccf8378d95 |
gemma-4-26B-A4B-it-assistant-F16.ggufik_llama.cpp:397150ca MTP: faster recurrent state restore (#1791)llama-quantize SHA256: 15ca21cbd3881326cec391325d663fed94122fe87a42d84373682b1612d9dc521/home/joel/Projects/ik_llama.cpp/build-cuda/bin/llama-quantize \
2 gemma-4-26B-A4B-it-assistant-F16.gguf \
3 gemma-4-26B-A4B-it-assistant-Q6_K.gguf \
4 Q6_K \
5 121main: build = 4482 (5fe010f0)
2llama_model_quantize_internal: model size = 800.57 MB
3llama_model_quantize_internal: quant size = 328.40 MB1./build/bin/llama-server \
2 -m gemma-4-26B-A4B-it-UD-IQ4_XS.gguf \
3 -c 20480 \
4 --model-draft gemma-4-26B-A4B-it-assistant-Q6_K.gguf \
5 --spec-type mtp \
6 -ngld 999 \
7 --draft-max 2 \
8 --draft-p-min 0.0 \
9 -ctk q4_0 \
10 -ctv q4_0 \
11 --jinja--draft-max 1 and --draft-max 2 are both reasonable starting points. Local
results are workload-sensitive, so treat this as a practical assistant option
rather than a universal speed claim.gemma-4-26B-A4B-it-UD-IQ4_XS.ggufik_llama.cpp commit: 397150ca20480--draft-max 2| Draft | Size | Mean TG | Acceptance |
|---|---|---|---|
| Q4_K_S | 307 MiB | 35.62 tok/s | 220/360 = 61.1% |
| Q6_K | 344 MiB | 45.71 tok/s | 232/360 = 64.4% |