1# Voice Design — generate a voice from a text description:
2crispasr --backend irodori-tts \
3 -m irodori-tts-600m-v3-voicedesign-q4_k.gguf \
4 --codec-model dacvae-ja-32dim-f16.gguf \
5 --instruct "落ち着いた大人の男性。フォーマルな場で、深く響く声で丁寧に話している。" \
6 --tts "こんにちは、世界。" \
7 --tts-output voicedesign.wav
8
9# Style-controlled voice cloning:
10crispasr --backend irodori-tts \
11 -m irodori-tts-600m-v3-voicedesign-q4_k.gguf \
12 --codec-model dacvae-ja-32dim-f16.gguf \
13 --voice reference.wav --i-have-rights \
14 --instruct "元気で明るい女性。笑顔で楽しそうに話している。" \
15 --tts "今日はいい天気ですね!" \
16 --tts-output cloned_styled.wav
17
18# Auto-download (fetches both model + codec):
19crispasr --backend irodori-tts-voicedesign -m auto --auto-download \
20 --instruct "優しい声の女性。" \
21 --tts "テスト。" --tts-output out.wav
MIT (same as the original model). See
Aratako/Irodori-TTS-600M-v3-VoiceDesign for usage restrictions (no impersonation without consent, AI-generated audio disclaimer required for caption-only outputs).