Views
No views yet
meituan-longcat/LongCat-AudioDiT-3.5B using mlx-audio version 0.4.3.pip install -U mlx-audio1from mlx_audio.tts.utils import load
2
3model = load("mlx-community/LongCat-AudioDiT-3.5B-nvfp4")
4
5result = next(model.generate("Hello, this is a test of AudioDiT."))
6audio = result.audio # mlx array, 24kHz1from mlx_audio.tts.audio_player import AudioPlayer
2
3player = AudioPlayer(sample_rate=24000)
4result = next(model.generate("The quick brown fox jumps over the lazy dog."))
5player.queue_audio(result.audio)
6player.wait_for_drain()
7player.stop()guidance_method="apg" for best voice cloning quality:1result = next(model.generate(
2 text="Today is warm turning to rain, with good air quality.",
3 ref_audio="reference.wav",
4 ref_text="Transcript of the reference audio.",
5 guidance_method="apg",
6 cfg_strength=4.0,
7 steps=16,
8))1result = next(model.generate(
2 text="今天晴暖转阴雨,空气质量优至良,空气相对湿度较低。",
3 steps=16,
4 cfg_strength=4.0,
5))| Parameter | Default | Description |
|---|---|---|
steps | 16 | Euler ODE solver steps. Higher = better quality, slower |
cfg_strength | 4.0 | Classifier-free guidance strength |
guidance_method | "cfg" | "cfg" for TTS, "apg" for voice cloning |
seed | 1024 | Random seed for reproducibility |
ref_audio | None | Reference audio for voice cloning (24kHz) |
ref_text | None | Transcript of the reference audio |
1# Zero-shot TTS
2python -m mlx_audio.tts.generate \
3 --model mlx-community/LongCat-AudioDiT-3.5B-nvfp4 \
4 --text "Hello, this is a test of AudioDiT." \
5 --play
6
7# Voice cloning
8python -m mlx_audio.tts.generate \
9 --model mlx-community/LongCat-AudioDiT-3.5B-nvfp4 \
10 --text "Today is warm turning to rain." \
11 --ref_audio reference.wav \
12 --ref_text "Transcript of the reference audio." \
13 --play