Views
No views yet
gemma-4-31B-it-qat in llama.cpp./home/gochu/workspace/repos/llama.cpp-gemma4-mtp/build/bin/llama-server \
-m /home/gochu/workspace/models/gguf/gemma/qat/gemma-4-31B_q4_0-it.gguf \
-md /home/gochu/workspace/models/gguf/gemma/draft/gemma-4-31B-it-qat-q4_0-unquantized-assistant-q8_0.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--host 0.0.0.0 \
--port 8080 \
-c 128000 \
-ngl 99 \
-sm tensor \
-b 2048 \
-ub 512 \
-fa on \
-np 1 \
--jinja \
--chat-template-kwargs '{"enable_thinking":true}'