Qwen3.6-27B-KQVQ4-IQ3Floor-10G-MTP-GGUF
单文件 · 约 10.9 GB(10.1 GiB)· 约 3.18 BPW — 对 Qwen3.6-27B 密集编码模型进行混合精度再量化,嵌入了 MTP 头, 已在一台16 GB 显存的 GPU.
这是什么?
该仓库包含一个混合精度(混合精度)GGUF: 在关键部位加以保护,其余部分则全面压缩.
注意:K/Q/V 锚定层保持 Q4_K 的精度;SSM 的 α/β 门控以及 MTP 头位于 IQ3_S 层级之上;所有 FFN 均置于 IQ3_XXS 层级;每个归一化层均采用 F32 精度。模型经由重要性矩阵(imatrix)校准,该矩阵由 llama.cpp build 9940 (b989x) 构建,并通过 llama-quantize --allow-requantize --imatrix.
lineage:Qwen3.6-27B → DSV4Pro Distill → GLM5.2 SFT + GPT-5.5 RL(编码)→ 本次10G混合精度版本。
起源与致谢 / 底模与致谢
致敬**nerkyor——您基于DSV4Pro的蒸馏模型与GLM5.2 SFT / GPT-5.5 RL训练得到的编码基模型非常出色,而这个仓库正是在此基础上直接进行量化。混合精度分层方案(KQV-Q4 + IQ3 Floor)是在经过数十次我自己的量化实验后最终确定的——其核心理念是:在关键部位保持高精度,在其他部分采用低精度,并在整个计算过程中为每个张量设置下限保护。感谢您提供了一个出色的基模型。
文件——该下载哪一个?
| 文件 | 大小 |
|---|
Qwen3.6-27B-DSV4Pro-GLM52-Coding-LynnStyle-KQVQ4-IQ3Floor-10G-MTP.gguf | 10,868 MB(≈10.9 GB / 10.1 GiB) |
一个独立的完整文件 — MTP头部就包含在这个文件中。无需单独的草稿模型;请使用 --spec-type draft-mtp.
混合精度设计(KQV-Q4 + IQ3下限)
| 等级 | 类型 | BPW | 张量 | 用途 / 原因 |
|---|
| 1 · 锚点 | Q4_K | ~4.56 | 48 — 注意力 K/Q/V 在块 {3,7,…,63} 上(×16) | 因果链核心;硬性规则:KQV ≥ Q4_K |
| 2 · 门控与MTP | IQ3_S | ~3.16 | 170 — SSM α/β(128)+ 深层ssm_out门控 + token_embd/输出 + MTP头部 | 为提升稳定性而设置的比底层高一级的层级 |
| 3 · FFN 层 | IQ3_XXS | ~2.06 | 526 — 所有 FFN(包括降级的锚点 FFN)+ 非锚点注意力投影 | 计算密集型 → 压缩难度大 |
| 规范 | F32 | 32 | 199 — 每个规范层均保持全精度 | 数学要求,从不压缩 |
- 最低精度 ≥ IQ3_XXS(约2.06 BPW);结果: ≈3.18 BPW.
##快速入门(llama.cpp,已在b980x上验证)
1llama-server.exe -m "Qwen3.6-27B-DSV4Pro-GLM52-Coding-LynnStyle-KQVQ4-IQ3Floor-10G-MTP.gguf" \
2 -c 32768 -ngl 80 --kv-unified \
3 --jinja --reasoning on --reasoning-format deepseek \
4 --spec-type draft-mtp -np 1 --spec-draft-n-max 2 --spec-draft-p-min 0 \
5 --cache-type-k q4_0 --cache-type-v q4_0 -fa on \
6 --top-k 20 --top-p 0.95 --repeat-penalty 1.1 --min-p 0.0
-c 32768 是经过验证的上下文;若需更多显存余量,可将其调低(例如 -c 16384)。
- 如果您的 llama.cpp 构建未能从 GGUF 元数据中识别出聊天模板,请添加
--chat-template-file chat_template.jinja(如我们在测试中所用)。
为什么它适合 16 GB 显卡
≈10.1 GiB 的权重 + KV 缓存量化至 q4_0 @32K → 已在 RTX 5060 Ti 16GB 显卡上通过全卸载验证(-ngl 80),未出现 OOM。正是 KV 的量化,使得 ≤10G 的版本在 16 GB 显卡、32K 上下文规模下仍能正常使用——而在非 MTP 模式下,甚至可扩展至约 170K 的最大上下文规模(估算值,约 20 tok/s)。
主要优势/优点
- **体积小巧:**单文件约10G(约3.18 BPW),无需Sidecar——是为数不多仍能将KQV锚定在Q4_K的极小构建之一。
- **在 MTP 下的长上下文:**KV q4_0 + 嵌入式 MTP Head → 最大可支持约 13 万条上下文(KV 预估;我们的实测验证结果为
-c 32768),且即使启用 MTP,吞吐量仍大致维持在 20–30 多 t/s 的水平(RTX 5060 Ti 16GB)。
- 无MTP的深度上下文:非MTP模式可将窗口扩展至超过~17万的最大上下文(估算值),但吞吐量仍维持在约~20 tok/s——正是KV q4_0量化使得如此长的序列能够容纳在16 GB内存中。
- **高智商品质:**在同等规模的量化模型中表现出色,推理能力显著领先,指令遵循稳健且强大——在其约10G规模的同类模型中,堪称最具智慧之选(根据我们的多模型对比:性价比之首)。
运行结果(参考)
**方法:**每道问题均在 llama.cpp b9804 上的新一轮聊天会话中作答(RTX 5060 Ti 16GB, -c 32768, KV q4_0,通过 --kv-unified,MTP draft-n-max=2);针对每道题目记录实际耗时、每秒处理的标记数以及 MTP 的接受率。通过 = 以下参考答案的得分已正确生成 且未导致服务器崩溃(即使在 max_tokens=1200).
| # | 类别 | 问题(简略) | 经核实的参考答案 | 最大令牌数 |
|---|
| 第1题 | 逻辑谜题 ★★★★★ | 三个开关与三盏灯——仅允许进入房间一次;确定每个开关对应的灯 | **灯泡余热法:**先打开开关1约5分钟→关闭,再打开开关2,然后进入房间一次:亮着的灯 = 开关2 · 温暖但不亮的灯 = 开关1(余温)· 又冷又暗的灯 = 开关3。 利用通电灯泡在关闭后仍保持高温这一特性。 | 800 |
| 第二季度 | 数学证明 ★★★★☆ | 证明对于任意整数n,n³−n都能被6整除 | 因式分解:n³−n = (n−1)·n·(n+1),三个连续整数的乘积必然能被2(其中必有一个是偶数)和3(其中必有一个是3的倍数)整除;由于gcd(2,3)=1,因此它能被lcm(2,3)=6整除。证毕 | 600 |
| 第三季度 | 代码生成 ★★★★☆ | 带单元测试用例的 Python O(1) LRU 缓存 | LRUCache = dict(键→Node) + 双向链表,带虚拟头尾; get() 会将节点移动到最久未使用的端—— O(1); put() 在容量超出时会移除LRU队列的末尾元素;包含可运行的 test_lru() 测试用例,用于验证淘汰顺序、键值更新以及容量为零的边界情况。 | 1200 |
| 第四季度 | 古典汉诗 ★★★★★ | 七言绝句《秋夜思乡》,严格遵循平水韵与声调格律 | 四句七言,押韵脚均属同一平水韵部,韵脚后标注。参考格式:秋灯一盏照孤舟,客心一夜伴寒愁。月冷江声入枕远,归舟应在白云流 — 押韵脚 舟 / 愁 / 流 (下平十一尤). | 500 |
| 问题5 | 图算法 ★★★★★ | 枚举无向图中的所有简单路径(DFS + 回溯),并附复杂度分析与优化 | 从s出发,使用已访问集合和路径栈:在到达path[:]时记录t,退出时撤销访问。最坏情况**(n−2)!**条路径 ⇒ 指数级(#P难的枚举问题);已给出的缓解措施:深度上限、BFS/A*的邻域排序、针对N≤64的位掩码方法、并行搜索。 | 1200 |
注意:使用 ——推理依据(DeepSeek 格式),答案会通过推理轨迹逐条流式输出——例如,Q4 的整首诗草稿将通过`推理内容;客户端应同时捕获这两个字段以进行验证。
注意事项与限制
- K/QV 在 Q4_K 上的锚点:与源量化相比,精度损失较小,在实际应用中可接受。
- SSM α/β 降级为 IQ3_S:长上下文(>16K)可能会略有下降;短序列(<8K)几乎无感。
- MTP Head 嵌入在 IQ3_S 中:根据任务不同,接受率约为 50%–77%——但仍能带来净速度提升。
中文说明 / Chinese Description
本仓库是什么: Qwen3.6-27B 密集型编程模型的
混合精度 GGUF(KQV-Q4 + IQ3 Floor)——"关键部位保质量,其余极致压缩"。基于
nerkyor/Qwen3.6-27B-DSV4Pro-GLM52-SFT-GPT55-RL-Coding-GGUF 底模(Qwen3.6-27B → DSV4Pro Distill → GLM5.2 SFT + GPT-5.5 RL Coding)再量化而成,
单文件即含 MTP Head,约 10G 体积档,实测 16GB 显存显卡可完整加载(-ngl 全量入显存)。
混合精度分层设计
| 档位 | 类型 | BPW | 张量数 | 说明 |
|---|
| 一级·KQV锚点 | Q4_K | ~4.56 | 48 — 注意 K/Q/V @ blk.{3,7,…,63}(共16组) | 因果链核心,硬性约束 KQV ≥ Q4_K |
| 第二层 · SSM门控 + MTP | IQ3_S | ~3.16 | 170 — SSM α/β(128)+ 深层 ssm_out 门控 + token_embd/output + MTP 主头 | 比地板高一档保稳定 |
| 3级·FFN层 | IQ3_XXS | ~2.06 | 526 — 全部FFN(含锚点层降级)+ 非锚点的注意力投影 | 计算密集型,极限压缩 |
| Norm归一化 | F32 | 32 | 199 — 所有 norm 层全精度保留 | 数学要求,绝不压缩 |
量化链路:llama.cpp b989x(build 9940) llama-quantize --allow-requantize --imatrix --tensor-type-file(imatrix 496 张量条目 ×128 块 重要性校准)→ ≈3.18 BPW,最低精度 IQ3_XXS(~2.06 BPW)。
为什么 16GB 显卡可用?
权重 ≈10.1 GiB + KV Cache q4_0 量化(--kv-unified --cache-type-k/v q4_0)在 32K 上下文中占用大幅缩小 → 在 RTX 5060 Ti 16GB 上实测 -ngl 80 全量入显存、无 OOM。KV 量化是本方案能压进 16G 显卡的关键 —— 非 MTP 模式下最大上下文可放宽到 170K 以上(按 KV 预算估算;本地实测验证至 -c 32768,速度约 ~20 tok/s)。
核心优点 / Pros
- 小体积: ~10G 单文件(~3.18 BPW),无 sidecar,KQV 锚点仍保持 Q4_K —— 同级方案中体积最小的一档之一。
- MTP 下长上下文可用: KV q4_0 + 内嵌 MTP Head → 约 130K 超长上下文可跑(按 KV 预算估算;本地实测验证至
-c 32768),且 MTP 开启时吞吐仍保持在 约20多~30+ tok/s(RTX 5060 Ti 16GB)。
- 非 MTP 下极限长上下文: 关闭 MTP 时最大上下文可扩展到 170K 以上(估算,≈20 tok/s)—— KV q4_0 量化让如此长的序列也能装进 16G 显存。
- 高智商质量: 推理能力明显高于同体积的其它量化版本,指令服从度高且稳定 —— ~10G 同级中智力表现最强的一款(本仓库多模型对比测试结论:"性价比之王")。
运行结果(参考值)
**测试方法:**每道题独立开会话测试(llama.cpp b9804,RTX 5060 Ti 16GB,-c 32768,KV q4_0 --kv-unified,MTP draft-n-max=2),逐题记录耗时 / tok/s / MTP 接受率。通过标准: 下方参考答案要点答对且无服务器崩溃(含 max_tokens=1200 长文本)。结果:5/5 全通过。
| # | 类别 | 题目 | 已验证参考答案 | 最大标记数 |
|---|
| 第1题 | 逻辑推理 ★★★★★ | 3个开关3盏灯,只能进房间一次 —— 确定每个开关对应的灯 | 热灯法:开 sw-1 约5分钟 → 关闭 → 改开 sw-2 → 进房一次:亮着 = sw-2 · 热而不亮 = sw-1(余温)· 冷而暗 = sw-3。利用通电灯泡断电后仍有温度的物理特性。 | 800 |
| Q2 | 数学证明 ★★★★☆ | 对任意整数 n,n³−n 能被6整除的证明 | 因式分解 n³−n=(n−1)·n·(n+1),三个连续整数之积 ⇒ 必被 2(其中含偶数)与 3(其中含3的倍数)整除;gcd(2,3)=1,故被 lcm(2,3)=6 整除。证毕。 | 600 |
| 第三季度 | 代码生成 ★★★★☆ | Python 实现 O(1) LRU 缓存(含单元测试用例) | LRUCache = dict(键→Node) + 带 dummy 头/尾的双向链表;get() 将节点移到 MRU 端 —— O(1);put() 超容时淘汰 LRU 端;附可运行的 test_lru():覆盖淘汰顺序、键值更新与容量0边界。 | 1200 |
path[:],退出时撤销访问。最坏 (n−2)!
汇总指标:平均速度 ~43 t/s,MTP 接受率均值 ~64%(51–77%,依题型浮动)。
注:——推理依据(DeepSeek 格式)下回答经推理链流式输出 —— 例如 Q4 的诗稿全文走 推理内容`;校验时需同时捕获该字段。
局限性
- K/QV 锚点 Q4_K:相比源量化有轻微保真损失,实际可接受;
- SSM α/β 降至 IQ3_S:超长上下文(>16K)可能略有下降,短序列(<8K)几乎无感知差异;
- MTP Head 内嵌(IQ3_S):接受率 ~50–77%,仍带来净加速收益。
###致谢 / 致谢
特别感谢 nerkyor —— 您的 DSV4Pro Distill + GLM5.2 SFT/GPT-5.5 RL Coding 底模非常出色,本仓库在其之上量化而成。**KQV-Q4 + IQ3 Floor 混合精度分层方案是本人反复试验数十次量化后确定的:思维方法为重要部位高精度、次要部分低精度、全程由地板(IQ3_XXS)兜底。**谨以此档向原作者致敬。
基于 llama.cpp build 9940(b989x 量化)构建 / 在 b9804 上测试 · 单文件,无需 sidecar。