Views
No views yet
| 部分 | 位宽 | group size | 说明 |
|---|---|---|---|
| GDN in_proj_qkv / in_proj_z | 4bit | 128 | GDN 线性层容错性好,大胆压缩 |
| GDN MLP gate/up/down | 4bit | 128 | 计算量主体,4bit 大幅省显存 |
| GDN out_proj | 8bit | 64 | 输出路径保留精度 |
| self-attention o_proj + MLP | 8bit | 128 | 注意力输出关键路径 8bit |
| self-attention in_proj_qkv | FP16 未量化 | — | q/k/v 投影对量化最敏感,保持全精度 |
| embedding / norm / conv | FP16 | — | 全精度 |
recipe.yaml| 上下文 | prefill 耗时 | 吞吐 |
|---|---|---|
| 25K | 20.4s | 1224 tok/s |
| 128K | 126.1s | 1016 tok/s |
| 256K | 342.8s | 744 tok/s |
--attention-backend FLASHINFER(FlashInfer 0.6.8+ 支持 sm_75 prefill)--kv-cache-dtype int8_per_tensor(启用 int8 KV,解锁 256K)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "superniker/qwen3.8-27b-g8l4i",
5 trust_remote_code=True,
6 device_map="auto",
7)
8tokenizer = AutoTokenizer.from_pretrained(
9 "superniker/qwen3.8-27b-g8l4i", trust_remote_code=True
10)