| 项 | 值 |
|---|---|
| 基座模型 | Qwen3-0.6B |
| 导出格式 | MNN(export_args.json 中 export: "mnn") |
| 推理后端 | Hexagon cDSP(backend_type: "hexagon",MNN 自研 Hexagon 后端) |
| 权重量化 | 4-bit(quant_bit=4, quant_block=64, symmetric) |
| 精度配置 | precision: low, memory: low |
| 总大小 | ~308 MB |
⚠️ 这是 MNN 专用格式,不是 Hugging Facetransformers的safetensors/bin格式,无法用AutoModel.from_pretrained直接加载。需使用 MNN-LLM App 或 MNN 推理引擎,并选择hexagon后端。
qwen3_0_6b_hexagon/
├── llm.mnn # MNN 计算图
├── llm.mnn.weight # 4-bit 量化权重 (303 MB)
├── llm.mnn.json # 导出配置
├── config.json # MNN 配置(含 chat template)
├── llm_config.json # MNN-LLM 推理配置(采样参数等)
├── tokenizer.mtok # MNN tokenizer
└── export_args.json # 导出参数记录hexagon,推理将 offload 到 Hexagon cDSP:llm.mnn + llm.mnn.weighttokenizer.mtokllm_config.json⚠️ 本模型针对 MNN 自研 Hexagon cDSP 后端(FastRPC + 自研 HVX/HMX kernel)优化,不是 QNN / 高通 AI Engine Direct 路线。
quant_bit=4, quant_block=64, sym=truetie_word_embeddings,与 lm_head 共享权重(export_args.json 中 tie_word_embeddings: true)