Views
No views yet
google/gemma-4-E4B-it-assistant MTP (Multi-Token Prediction) drafter, for use with llama.cpp speculative decoding.gemma4_assistant (underscore) instead of upstream llama.cpp's gemma4-assistant (hyphen) — which makes them fail to load on any modern llama.cpp build.convert_hf_to_gguf.py (b10215 / commit eb41d503b), so every metadata key is correctly namespaced and it loads cleanly on upstream llama.cpp.1llama-server \
2 -m gemma-4-E4B_q4_0-it.gguf \
3 --model-draft gemma-4-E4B-it-assistant-official.bf16.gguf \
4 --spec-type draft-mtp \
5 --spec-draft-n-max 3 \
6 -ngl 99 -c 8192 -fa on -ub 2048 -b 2048 \
7 --jinja --reasoning off \
8 --host 0.0.0.0 --port 8000| Metric | Value |
|---|---|
| Decode | 114.1 tok/s |
| MTP acceptance rate | 66.7% |
| Prefill @ 2K tokens | 2,319 tok/s |
| VRAM (target + drafter, Q4_0 target + BF16 drafter) | 7 GiB |
1git clone https://github.com/ggml-org/llama.cpp
2cd llama.cpp && git checkout b10215
3pip install --index-url https://download.pytorch.org/whl/cpu torch
4
5hf download google/gemma-4-E4B-it-assistant --local-dir gemma-4-E4B-it-assistant-hf
6python convert_hf_to_gguf.py gemma-4-E4B-it-assistant-hf/ \
7 --outfile gemma-4-E4B-it-assistant-official.bf16.gguf \
8 --outtype bf16gemma-4-E4B-it-assistant-official.bf16.gguf — 172 MB, BF16google/gemma-4-E4B-it-assistantconvert_hf_to_gguf.py at commit eb41d503b (b10215)