Views
No views yet
| Model | Token Rate | Vocab Size | Bit Rate | Sample Rate | SSL Encoder | Vocoder | Parameters | Highlights |
|---|---|---|---|---|---|---|---|---|
| MioCodec-25Hz-24kHz | 25 Hz | 12,800 | 341 bps | 24 kHz | WavLM-base+ | - (iSTFTHead) | 132M | Lightweight, fast inference |
| MioCodec-25Hz-44.1kHz | 25 Hz | 12,800 | 341 bps | 44.1 kHz | WavLM-base+ | MioVocoder (Jointly Tuned) | 118M (w/o vocoder) | High-quality, high sample rate |
| kanade-25hz | 25 Hz | 12,800 | 341 bps | 24 kHz | WavLM-base+ | Vocos 24kHz | 118M (w/o vocoder) | Original 25Hz model |
| kanade-12.5hz | 12.5 Hz | 12,800 | 171 bps | 24 kHz | WavLM-base+ | Vocos 24kHz | 120M (w/o vocoder) | Original 12.5Hz model |
1# Install via pip
2pip install git+https://github.com/Aratako/MioCodec
3
4# Or using uv
5uv add git+https://github.com/Aratako/MioCodec
61from miocodec import MioCodecModel, load_audio
2import soundfile as sf
3
4# 1. Load model
5model = MioCodecModel.from_pretrained("Aratako/MioCodec-25Hz-24kHz").eval().cuda()
6
7# 2. Load audio
8waveform = load_audio("input.wav", sample_rate=model.config.sample_rate).cuda()
9
10# 3. Encode Audio
11features = model.encode(waveform)
12
13# 4. Decode to Waveform (directly, no vocoder needed)
14resynth = model.decode(
15 content_token_indices=features.content_token_indices,
16 global_embedding=features.global_embedding,
17)
18
19# 5. Save
20sf.write("output.wav", resynth.cpu().numpy(), model.config.sample_rate)1source = load_audio("source_content.wav", sample_rate=model.config.sample_rate).cuda()
2reference = load_audio("target_speaker.wav", sample_rate=model.config.sample_rate).cuda()
3
4# Perform conversion
5vc_wave = model.voice_conversion(source, reference)
6sf.write("converted.wav", vc_wave.cpu().numpy(), model.config.sample_rate)[32, 64, 128, 256, 512, 1024, 2048].[32, 64, 128, 256, 512, 1024, 2048].[2, 3, 5, 7, 11, 17, 23].[118, 190, 310, 502, 814, 1314, 2128, 3444].| Language | Approx. Hours | Dataset |
|---|---|---|
| Japanese | ~22,500h | Various public HF datasets |
| English | ~500h | Libriheavy-HQ |
| English | ~4,000h | MLS-Sidon |
| English | ~9,000h | HiFiTTS-2 |
| English | ~27,000h | Emilia-YODAS |
| German | ~1,950h | MLS-Sidon |
| German | ~5,600h | Emilia-YODAS |
| Dutch | ~1,550h | MLS-Sidon |
| French | ~1,050h | MLS-Sidon |
| French | ~7,400h | Emilia-YODAS |
| Spanish | ~900h | MLS-Sidon |
| Italian | ~240h | MLS-Sidon |
| Portuguese | ~160h | MLS-Sidon |
| Polish | ~100h | MLS-Sidon |
| Korean | ~7,300h | Emilia-YODAS |
| Chinese | ~300h | Emilia-YODAS |
1@misc{miocodec-25hz-24khz,
2 author = {Chihiro Arata},
3 title = {MioCodec: High-Fidelity Neural Audio Codec for Efficient Spoken Language Modeling},
4 year = {2026},
5 publisher = {Hugging Face},
6 journal = {Hugging Face repository},
7 howpublished = {\url{https://huggingface.co/Aratako/MioCodec-25Hz-24kHz}}
8}