Views
No views yet
MioCodec-25Hz-24kHz with the following architectural enhancements:MioCodec-25Hz-24kHz. You can take any TTS model trained on the 24kHz tokens and simply swap the codec to this v2 model during inference to instantly upgrade the audio quality to 44.1 kHz.| Model | Token Rate | Vocab Size | Bit Rate | Sample Rate | SSL Encoder | Vocoder | Parameters | Highlights |
|---|---|---|---|---|---|---|---|---|
| MioCodec-25Hz-44.1kHz-v2 | 25 Hz | 12,800 | 341 bps | 44.1 kHz | WavLM-base+ | - (iSTFTHead) | 133M | Fast inference, good quality |
| MioCodec-25Hz-24kHz | 25 Hz | 12,800 | 341 bps | 24 kHz | WavLM-base+ | - (iSTFTHead) | 132M | Lightweight, fast inference |
| MioCodec-25Hz-44.1kHz | 25 Hz | 12,800 | 341 bps | 44.1 kHz | WavLM-base+ | MioVocoder (Jointly Tuned) | 118M (w/o vocoder) | High-quality, high sample rate |
| kanade-25hz | 25 Hz | 12,800 | 341 bps | 24 kHz | WavLM-base+ | Vocos 24kHz | 118M (w/o vocoder) | Original 25Hz model |
| kanade-12.5hz | 12.5 Hz | 12,800 | 171 bps | 24 kHz | WavLM-base+ | Vocos 24kHz | 120M (w/o vocoder) | Original 12.5Hz model |
1# Install via pip
2pip install git+https://github.com/Aratako/MioCodec
3
4# Or using uv
5uv add git+https://github.com/Aratako/MioCodec
61from miocodec import MioCodecModel, load_audio
2import soundfile as sf
3
4# 1. Load model
5model = MioCodecModel.from_pretrained("Aratako/MioCodec-25Hz-44.1kHz-v2").eval().cuda()
6
7# 2. Load audio
8waveform = load_audio("input.wav", sample_rate=model.config.sample_rate).cuda()
9
10# 3. Encode Audio
11features = model.encode(waveform)
12
13# 4. Decode to Waveform (directly, no vocoder needed)
14resynth = model.decode(
15 content_token_indices=features.content_token_indices,
16 global_embedding=features.global_embedding,
17)
18
19# 5. Save
20sf.write("output.wav", resynth.cpu().numpy(), model.config.sample_rate)1source = load_audio("source_content.wav", sample_rate=model.config.sample_rate).cuda()
2reference = load_audio("target_speaker.wav", sample_rate=model.config.sample_rate).cuda()
3
4# Perform conversion
5vc_wave = model.voice_conversion(source, reference)
6sf.write("converted.wav", vc_wave.cpu().numpy(), model.config.sample_rate)1@misc{miocodec-25hz-44.1khz-v2,
2 author = {Chihiro Arata},
3 title = {MioCodec: High-Fidelity Neural Audio Codec for Efficient Spoken Language Modeling},
4 year = {2026},
5 publisher = {Hugging Face},
6 journal = {Hugging Face repository},
7 howpublished = {\url{https://huggingface.co/Aratako/MioCodec-25Hz-44.1kHz-v2}}
8}