Views
No views yet
cd llama.cpp && uv run python convert_hf_to_gguf.py /models/hf/Qwen3.6-35B-A3B-NVFP4-nvidia --outfile /models/gguf/Qwen3.6-35B-A3B-NVFP4-nvidia.gguf/home/gochu/workspace/repos/llama.cpp/build/bin/llama-server \
-m /home/gochu/workspace/models/gguf/qwen/Qwen3.6-35B-A3B-NVFP4-nvidia \
--host 0.0.0.0 \
--port 8080 \
-c 128000 \
-ngl 99 \
-b 2048 \
-ub 1024 \
-sm tensor \
-fa on \
-np 1 \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.00 \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--chat-template-kwargs '{"preserve_thinking":true}' \
--jinja \
--no-mmproj-offload \
--mmproj /home/gochu/workspace/models/gguf/qwen/mmproj/mmproj-Qwen-Qwen3.6-27B-Q6_K.gguf \
--image-min-tokens 1024