Views
No views yet
google/gemma-4-31B-it-qat-q4_0-unquantized-assistant.Q4_0-Q4emb — recommended for most usersQ4_0-Q6emb — standard llama.cpp quantizationgemma-4-31b-qat-it-assistant-bf16.ggufgemma-4-31b-qat-it-assistant-Q4_0-Q4emb.ggufgemma-4-31b-qat-it-assistant-Q4_0-Q6emb.ggufQ4_0-Q4emb keeps token_embd.weight in Q4_0, making it closer to the original QAT layout.1llama-server \
2 -m gemma-4-31B-it-qat-Q4_0.gguf \
3 -md gemma-4-31b-qat-it-assistant-Q4_0-Q4emb.gguf \
4 --spec-type draft-mtp \
5 --spec-draft-n-max 2--spec-draft-n-max 2 for general use--spec-draft-n-max 3 for coding workloads--spec-draft-n-max 4 may help on highly repetitive tasks