Views
No views yet
TYPE_FFN_GATE_UP_EXPS=IQ2_XXS
TYPE_FFN_DOWN_EXPS=IQ3_XXS
TYPE_TOKEN_EMBEDDING=Q4_K
TYPE_OUTPUT=Q6_K
TYPE_DEFAULT=Q8_0llama-server --no-mmap --no-warmup -fa on --model IQ3_XXS/Qwen3.5-397B-A17B-IQ3_XXS-00001-of-00004.gguf --mmproj mmproj-F16.gguf --ctx-size 131072 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -cram 0-cram 0 because the model + context will take 100% of my available RAM../scripts/convert-to-gguf.sh ~/llama.cpp ../../Qwen/Qwen3.5-397B-A17B
./scripts/quantize.sh ~/code/llama.cpp IQ3_XXS