Views
No views yet
cd /home/gochu/workspace/repos/llama.cpp && uv run python convert_hf_to_gguf.py /home/gochu/workspace/models/hf/gemma-4-31B-it-qat-assistant-NVFP4-Blackwell --outfile /home/gochu/workspace/models/gguf/gemma/gemma-4-31B-it-qat-assistant-NVFP4-Blackwell.gguf/home/gochu/workspace/repos/llama.cpp/build/bin/llama-server \
-m /home/gochu/workspace/models/gguf/gemma/qat/gemma-4-31B-it-qat-NVFP4-Blackwell.gguf \
-md /home/gochu/workspace/models/gguf/gemma/draft/gemma-4-31B-it-qat-q4_0-unquantized-assistant-q8_0.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--host 0.0.0.0 \
--port 8080 \
-c 96000 \
-ngl 99 \
-sm tensor \
-b 2048 \
-ub 128 \
-fa on \
-np 1 \
--jinja \
--chat-template-file /home/gochu/workspace/models/hf/chat-templates/gemma-4-31B-it-chat_template.jinja
# --mmproj /home/gochu/workspace/models/gguf/gemma/mmproj/gemma-4-31B-it-mmproj.gguf \
# --no-mmproj-offload