Views
No views yet
中文语音合成(TTS)模型,已转换为 Apple MLX 格式,并采用 OPTIQ 混合精度 int8 量化(28 层 float32 + 68 层 int8),可在 Apple Silicon 上本地推理。
该混合精度配置经多种精度组合实测比较后选定,已在 Apple M5 Max 芯片上实测可用,同时保留了绝大部分语音生成性能。
| 参数 | 值 |
|---|---|
| 量化比特 | 8(int8) |
| 量化组大小(group size) | 64 |
| 量化方式 | 分组缩放(每 64 个权重共享一个 scale) |
| 量化范围 | 仅 T2S 主模型 + W2V-BERT 编码器 |
config.json:1{
2 "model_type": "confucius4",
3 "sample_rate": 22050,
4 "quant_bits": 8,
5 "quant_group_size": 64
6}| 文件 | 大小 | 角色 | 精度 |
|---|---|---|---|
t2s_model.safetensors | 1.39 GB | 文本→语义 token(LLM Transformer,24 层) | 混合:float32 + int8 |
w2vbert_mlx.safetensors | 591 MB | 语音语义编码器(W2V-BERT-2.0) | 混合:float32 + int8 |
s2a_mlx.safetensors | 397 MB | 语义 token→声学(语音解码器) | float32 |
bigvgan_mlx.safetensors | 428 MB | 声码器(HiFi-GAN 类) | float32 |
campplus.safetensors | 26 MB | 说话人/参考音色编码器 | float32 |
checkpoints/tokenizer.json 分词器。t2s_model.safetensors,24 层 Decoder)| 张量 | 精度 | 量化层 |
|---|---|---|
mlp.c_fc.weight + mlp.c_proj.weight | int8 | 全部 24 层 |
attn.c_attn.weight(QKV 合并投影) | int8 | 层 2–9、12–23(20 层) |
attn.c_attn.weight | float32(保留) | 层 0、1、10、11(4 层) |
attn.c_proj.weight | float32(保留) | 全部 24 层 |
c_attn 与全部 c_proj 保留 float32。w2vbert_mlx.safetensors)self_attn.linear_q/k/v/out 与 ffn1/ffn2 的 intermediate_dense/output_dense 均量化。s2a_mlx、bigvgan_mlx、campplus 均为全 float32,未量化——语音解码、声码、说话人编码等影响音频质量的模块保持高精度。group_size=64 的 int8 进行,主要缩减 LLM 与语义编码器模型体积;音频质量关键层保留 float32,以兼顾体积与音质。1import mlx.core as mx
2from mlx_lm.utils import load # 或以 mlx-audio 的 Confucius 加载接口为准