Views
No views yet
self_attn.o_proj 與 mlp.down_proj,共 52 層 104 個矩陣)中,將「拒絕方向」正交化移除。| 量化 | 檔案大小 | 說明 |
|---|---|---|
| bf16 | 52 GB | 全精度參考版,作為量化來源 |
| Q8_0 | 28 GB | 近乎無損 |
| Q6_K | 22 GB | 高品質 |
| Q5_K_M | 19 GB | 品質與體積平衡 |
| Q4_K_M | 16 GB | 一般部署建議 |
| IQ4_XS | 15 GB | 以 importance matrix 量化 |
| IQ2_M | 9.2 GB | 最小體積,以 importance matrix 量化,適合記憶體吃緊的環境 |
mmproj.gguf(視覺投影,約 1.4 GB,看圖必需)、imatrix.dat(量化用的 importance matrix)。1llama-server -m Muse-Glimmer-30B-Uncensored-xCloud-Q4_K_M.gguf \
2 --jinja -ngl 99 -c 8192 \
3 --temp 0.6 --top-p 0.95 --top-k 64--mmproj:1llama-server -m Muse-Glimmer-30B-Uncensored-xCloud-Q4_K_M.gguf \
2 --mmproj Muse-Glimmer-30B-Uncensored-xCloud-mmproj.gguf \
3 --jinja -ngl 99 -c 8192Reasoning strength: low;複雜的程式/代理任務可用 high 或 xhigh。temp 0.6 / top_p 0.95 / top_k 64。self_attn.o_proj and mlp.down_proj;
104 matrices across 52 layers).| Quant | Size | Notes |
|---|---|---|
| bf16 | 52 GB | full-precision reference / quantization source |
| Q8_0 | 28 GB | near-lossless |
| Q6_K | 22 GB | high quality |
| Q5_K_M | 19 GB | quality/size balance |
| Q4_K_M | 16 GB | recommended for deployment |
| IQ4_XS | 15 GB | importance-matrix quantized |
| IQ2_M | 9.2 GB | smallest, importance-matrix quantized, for memory-constrained setups |
mmproj.gguf (vision projection, ~1.4 GB, required for image input) and imatrix.dat.1llama-server -m Muse-Glimmer-30B-Uncensored-xCloud-Q4_K_M.gguf \
2 --jinja -ngl 99 -c 8192 \
3 --temp 0.6 --top-p 0.95 --top-k 64--mmproj:1llama-server -m Muse-Glimmer-30B-Uncensored-xCloud-Q4_K_M.gguf \
2 --mmproj Muse-Glimmer-30B-Uncensored-xCloud-mmproj.gguf \
3 --jinja -ngl 99 -c 8192Reasoning strength: low in the system prompt; use high or xhigh for complex coding/agentic tasks.temp 0.6 / top_p 0.95 / top_k 64.