Views
No views yet
bosonai/higgs-audio-v2-generation-3B-base quantized to 6-bit. 3B Llama-3.2-backed text-to-speech with multi-codebook acoustic tokens and delay-pattern streaming. Real-time voice cloning on Apple Silicon.Blaizzy/mlx-audio (pending upstream merge — currently on the higgs-audio-v2-port branch at kaioct-labs/mlx-audio).1from mlx_audio.tts.models.higgs_audio import HiggsAudioServer
2import soundfile as sf
3
4server = HiggsAudioServer.from_pretrained(
5 model_path="mlx-community/higgs-audio-v2-3B-mlx-q6",
6 codec_path="mlx-community/higgs-audio-v2-tokenizer",
7)
8
9result = server.generate(
10 target_text="Hello from Higgs Audio on MLX.",
11 reference_audio_path="reference.wav",
12 reference_text="Transcript of the reference audio.",
13)
14sf.write("output.wav", result.pcm, result.sampling_rate)| variant | RTF | size |
|---|---|---|
| bf16 | 0.60× | 6.8 GB |
| q8 | 0.36× | 6.18 GB |
| q6 | 0.33× | 4.75 GB |
audio_codebook_embeddings and audio_decoder_proj.audio_lm_head kept at bf16 to preserve voice character. Config in config.json → quantization block, automatically honored by HiggsAudioServer.from_pretrained.