Full-precision (fp32) MLX build of
netease-youdao/Confucius4-TTS
(multilingual + cross-lingual zero-shot voice cloning, 14 languages: zh, en, ja,
ko, de, fr, es, id, it, th, pt, ru, ms, vi) for Apple Silicon.
All weights kept in fp32 (T2S, w2v-bert encoder, S2A flow, BigVGAN vocoder).
~5.4 GB total. For a smaller/faster 8-bit build see
mlx-community/Confucius4-TTS-mlx-int8.
1from mlx_audio.tts.utils import load
2model = load("mlx-community/Confucius4-TTS-mlx")
3for r in model.generate("Xin chào", ref_audio="voice.wav", lang="vi"):
4 ... # r.audio at 22050 Hz