Views
No views yet
google/gemma-4-26B-A4B-it-qat-q4_0-unquantized-assistant.Q4_0-q4emb — recommended for most usersQ8_0 — for users with spare VRAMgemma-4-26B-A4B-it-assistant-f16.ggufgemma-4-26b-A4B-it-assistant-Q4_0.ggufgemma-4-26b-A4B-it-assistant-Q4_0-q4emb.gguf (closest to pure Q4 QAT layout)gemma-4-26b-A4B-it-assistant-IQ4_NL-q4emb.ggufgemma-4-26b-A4B-it-assistant-IQ3_M-q4emb.gguf (smallest that still works)gemma-4-26b-A4B-it-assistant-Q8_0.ggufQ4_0-q4emb is an experimental quantization where token_embd.weight is kept in Q4_0 instead of Q6_K precision quantization typically used by llama.cpp.1llama-server \
2 -m gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf \
3 -md gemma-4-26b-A4B-it-assistant-Q4_0.gguf \
4 --spec-type draft-mtp \
5 --spec-draft-n-max 2--spec-draft-n-max 2 for general use--spec-draft-n-max 3 for coding workloads