Views
No views yet
llama.cpp using the original imatrix.dat.Qwen3.6-27B-Omnimerge-v4-MTP-F16.ggufQwen3.6-27B-Omnimerge-v4-MTP-IQ3_XXS.ggufQ4_K using tensor-specific quantization overrides due to reasons as documented in the original model.1llama-quantize \
2 --imatrix imatrix.dat \
3 --tensor-type blk.64.attn_k.weight=q4_K \
4 --tensor-type blk.64.attn_q.weight=q4_K \
5 --tensor-type blk.64.attn_output.weight=q4_K \
6 --tensor-type blk.64.ffn_down.weight=q4_K \
7 --tensor-type blk.64.ffn_gate.weight=q4_K \
8 --tensor-type blk.64.ffn_up.weight=q4_K \
9 --tensor-type blk.64.nextn.eh_proj.weight=q4_K \
10 Qwen3.6-27B-Omnimerge-v4-MTP-F16.gguf \
11 Qwen3.6-27B-Omnimerge-v4-MTP-IQ3_XXS.gguf \
12 IQ3_XXS1llama-server \
2 -m Qwen3.6-27B-Omnimerge-v4-MTP-IQ3_XXS.gguf \
3 --spec-type draft-mtp \
4 --spec-draft-n-max 2lm-evaluation-harness/v1/completionsManniX-ITA/Qwen3.6-27B-Omnimerge-v4)llama.cpp CUDA build b9632| Model | Tokenizer | HumanEval pass@1 | Size |
|---|---|---|---|
| Qwen3.6-27B-Omnimerge-v4-MTP-IQ3_XXS | ManniX-ITA/Qwen3.6-27B-Omnimerge-v4 | 80.49% ± 3.10% | 10.6 GB |
| ggufbench/Qwen3.6-27B-4bpw-16GB-VRAM | unsloth/Qwen3.6-27B | 81.10% ± 3.07% | 12.58 GB |
| unsloth/Qwen3.6-27B-MTP-GGUF:IQ2_M | unsloth/Qwen3.6-27B | 71.95% ± 3.52% | 10.2 GB |
1python -m lm_eval \
2 --model local-completions \
3 --model_args "model=Qwen3.6-27B-Omnimerge-v4-MTP-IQ3_XXS,base_url=http://127.0.0.1:1234/v1/completions,tokenizer=ManniX-ITA/Qwen3.6-27B-Omnimerge-v4,tokenizer_backend=huggingface" \
4 --tasks humaneval \
5 --batch_size 1 \
6 --confirm_run_unsafe_code/v1/completions rather than chat-completions.