Views
No views yet
model_convert/:ONNX 导出 + Pulsar2 编译脚本(可复现本 AXMODEL)python/ / cpp/:完整 SDK 源码与示例cpp/tests/:FFT/Griffin-Lim 本地自测| 场景 | 耗时 | RTF |
|---|---|---|
| AX650C 板端 NPU:S3Gen 单步(mel) | 181 ms / 512 帧(10.24s 音频) | ≈ 0.018 |
| AX650C 板端 NPU:端到端(S3Gen + HiFT 声码器,C++ server) | ~0.7 s / 2.3s 音频 | ≈ 0.3 |
| AX650C 板端 NPU:端到端(Python server,base/clone) | ~1.1 / ~1.9 s | ≈ 0.5 |
| NVIDIA L4 GPU(同模型,单步) | 47.2 ms | ≈ 0.0046 |
| 教师 10 步(L4,参考) | ~540 ms/句 | ≈ 0.06 |
models/hifift_f0.axmodel:mel → f0(纯卷积,U8,3.5 MB)models/hifift_decode.axmodel:mel + 源激励 STFT → raw(U16 双输出,27 MB)model_convert/hift_export.py 与 GitHub 源码仓库bash setup.shbash run.sh| 目录 | 用途 |
|---|---|
models/ | AXMODEL 模型文件 + 元信息 |
python/ | Python SDK(pyaxengine) |
cpp/ | C++ SDK(AX Engine runtime) |
model_convert/ | 模型导出 & 编译脚本(可复现) |
reports/ | 各阶段报告 |
setup.sh | 一键安装依赖 |
run.sh | 一键运行推理 |
bash setup.sh 会自动安装。python/demo.py,核心就 3 行:1from chatterbox-s3gen-onestep_sdk import ModelSDK
2sdk = ModelSDK("models/model.axmodel")
3result = sdk.run(your_input)model_convert/,确保 Pulsar2 可用后运行 bash compile_pulsar2.sh。
原始编译使用 Docker 镜像 docker-registry.aitsw.axera-tech.com/pulsar2:7.0。POST /v1/audio/speech(另含 GET /v1/models):输入 S3 speech token 序列,
输出 wav(response_format=wav)或 mel(response_format=mel)。Python 与 C++ 两版均可在 AX 板上运行,
不依赖 torch / ffmpeg / FFTW;文本 → token 的 T3 环节在宿主(torch)完成后调用本服务。声码器默认使用models/hifift_f0.axmodel+models/hifift_decode.axmodel(HiFT); 若缺省或指定不存在的路径则回退 Griffin-Lim。
1python3 python/openai_server.py --model models/model.axmodel \
2 --clone-model models/model_clone.axmodel --port 8000
3python3 python/openai_client.py --tokens-npy sample_input/tokens.npy --out out.wav本仓库cpp/bin/提供 aarch64 预编译产物(Release + fast-math);C++ 完整源码见 GitHub:https://github.com/ml-inory/chatterbox-onestep
1mkdir -p cpp/build && cd cpp/build
2cmake .. -DCMAKE_TOOLCHAIN_FILE=${AX_RUNTIME_ROOT}/toolchain.cmake -DAX_RUNTIME_ROOT=${AX_RUNTIME_ROOT}
3make -j$(nproc)
4./openai_server --model ../../models/model.axmodel \
5 --f0-model ../../models/hifift_f0.axmodel --decode-model ../../models/hifift_decode.axmodel \
6 --assets ../assets --port 8000
7./openai_client --url http://127.0.0.1:8000/v1/audio/speech --tokens-file <tokens_int32.bin> --out out.wavcpp/bin/ 里的预编译产物(板端加 LD_LIBRARY_PATH=/soc/lib):1./cpp/bin/openai_server --model models/model.axmodel \
2 --f0-model models/hifift_f0.axmodel --decode-model models/hifift_decode.axmodel \
3 --assets cpp/assets --port 8000cpp/assets/ 提供 mel_inv_24k.bin、default_embedding.bin 与 hift_linear_w/b.bin;python/hift_vocoder.py 与 cpp/include/hift_dsp.hpp(与 torch 原版一致,误差 ~1e-7)。models/model_clone.axmodel 支持参考音频 → 克隆音色(prompt 条件 + 音色 embedding),板端
调用方式与提取脚本(python/extract_voice_embedding.py)详见 GitHub 源码仓库:
https://github.com/ml-inory/chatterbox-onestep