Views
No views yet
./build/bin/llama-server \
--alias anikifoss/Qwen3-Coder-480B-A35B-Instruct-HQ4_K \
--model /mnt/data/Models/anikifoss/Qwen3-Coder-480B-A35B-Instruct-HQ4_K/Qwen3-Coder-480B-A35B-Instruct-HQ4_K-00001-of-00007.gguf \
--no-mmap -rtr \
--temp 0.5 --top-k 0 --top-p 1.0 --min-p 0.1 --repeat-penalty 1.0 \
--ctx-size 51000 \
-ctk f16 -ctv f16 \
-fa \
-b 1024 -ub 1024 \
-fmoe \
--n-gpu-layers 99 \
--override-tensor exps=CPU \
--parallel 1 \
--threads 32 \
--threads-batch 64 \
--host 127.0.0.1 \
--port 8090./build/bin/llama-server \
--alias anikifoss/Qwen3-Coder-480B-A35B-Instruct-HQ4_K \
--model /mnt/data/Models/anikifoss/Qwen3-Coder-480B-A35B-Instruct-HQ4_K/Qwen3-Coder-480B-A35B-Instruct-HQ4_K-00001-of-00007.gguf \
--no-mmap \
--temp 0.5 --top-k 0 --top-p 1.0 --min-p 0.1 --repeat-penalty 1.0 \
--ctx-size 51000 \
-ctk f16 -ctv f16 \
-fa \
-b 1024 -ub 1024 \
--n-gpu-layers 99 \
--override-tensor exps=CPU \
--parallel 1 \
--threads 32 \
--threads-batch 64 \
--host 127.0.0.1 \
--port 80901#!/usr/bin/env bash
2
3custom="
4# Token embedding and output tensors
5output\.weight=bf16
6output_norm\.weight=f32
7token_embd\.weight=bf16
8
9blk\.[0-9]\.attn_k\.weight=q8_0
10blk\.[0-9]\.attn_k_norm\.weight=f32
11blk\.[0-9]\.attn_norm\.weight=f32
12blk\.[0-9]\.attn_output\.weight=q8_0
13blk\.[0-9]\.attn_q\.weight=q8_0
14blk\.[0-9]\.attn_q_norm\.weight=f32
15blk\.[0-9]\.attn_v\.weight=q8_0
16blk\.[0-9]\.ffn_down_exps\.weight=q6_K
17blk\.[0-9]\.ffn_gate_exps\.weight=q4_K
18blk\.[0-9]\.ffn_up_exps\.weight=q4_K
19blk\.[0-9]\.ffn_gate_inp\.weight=f32
20blk\.[0-9]\.ffn_norm\.weight=f32
21blk\.[1-5][0-9]\.attn_k\.weight=q8_0
22blk\.[1-5][0-9]\.attn_k_norm\.weight=f32
23blk\.[1-5][0-9]\.attn_norm\.weight=f32
24blk\.[1-5][0-9]\.attn_output\.weight=q8_0
25blk\.[1-5][0-9]\.attn_q\.weight=q8_0
26blk\.[1-5][0-9]\.attn_q_norm\.weight=f32
27blk\.[1-5][0-9]\.attn_v\.weight=q8_0
28blk\.[1-5][0-9]\.ffn_down_exps\.weight=q6_K
29blk\.[1-5][0-9]\.ffn_gate_exps\.weight=q4_K
30blk\.[1-5][0-9]\.ffn_up_exps\.weight=q4_K
31blk\.[1-5][0-9]\.ffn_gate_inp\.weight=f32
32blk\.[1-5][0-9]\.ffn_norm\.weight=f32
33blk\.6[0-1]\.attn_k\.weight=q8_0
34blk\.6[0-1]\.attn_k_norm\.weight=f32
35blk\.6[0-1]\.attn_norm\.weight=f32
36blk\.6[0-1]\.attn_output\.weight=q8_0
37blk\.6[0-1]\.attn_q\.weight=q8_0
38blk\.6[0-1]\.attn_q_norm\.weight=f32
39blk\.6[0-1]\.attn_v\.weight=q8_0
40blk\.6[0-1]\.ffn_down_exps\.weight=q6_K
41blk\.6[0-1]\.ffn_gate_exps\.weight=q4_K
42blk\.6[0-1]\.ffn_up_exps\.weight=q4_K
43blk\.6[0-1]\.ffn_gate_inp\.weight=f32
44blk\.6[0-1]\.ffn_norm\.weight=f32
45"
46
47custom=$(
48 echo "$custom" | grep -v '^#' | \
49 sed -Ez 's:\n+:,:g;s:,$::;s:^,::'
50)
51
52echo "Running with: -custom-q $custom"
53
54TARGET_MODEL="Qwen3-Coder-480B-A35B-Instruct-HQ4_K"
55mkdir -p ~/Env/models/anikifoss/$TARGET_MODEL
56./build/bin/llama-quantize \
57 --custom-q "$custom" \
58 /mnt/data/Models/Qwen/Qwen3-Coder-480B-A35B-Instruct-GGUF/Qwen3-Coder-480B-A35B-Instruct-BF16-00001-of-00021.gguf \
59 ~/Env/models/anikifoss/$TARGET_MODEL/$TARGET_MODEL.gguf \
60 Q4_K \
61 32