Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
Irodori-TTS-500M-v2-duration-control – AI Model by kizuna-intelligence | AlphaNeural AI
You can deploy this model and start earning money today!
kizuna-intelligence
/
Irodori-TTS-500M-v2-duration-control
like
0
safetensors
tts
flow-matching
japanese
irodori-tts
text-to-speech
ja
Aratako/Irodori-TTS-500M-v2
finetune
apache-2.0
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
Irodori-TTS-500M-v2-duration-control (テスト版)
Irodori-TTS-500M-v2
をベースに、
生成duration(秒数)を指定して合成できる
ようにファインチューニングしたモデルです。
duration を明示することで、特に
30秒未満の短い音声で RTF(real-time factor)を改善
できます(指定した長さ以上に latent を生成しないため)。
テスト版
です。今後、より品質の高い学習版を公開予定なので少々お待ちください。
特徴
duration を秒数で指定して生成可能
短い発話で生成コストを抑えられる
ベースモデルで duration を短めに指定したときに語尾が途切れがちだった問題を解消
ベースモデルとほぼ同じ声質を維持
注意点
ゼロショット推論(参照音声 1 サンプルだけで声を真似る方式)では、ベースの v2 と比較して声質が若干低下する傾向があります。
目的の声質に揃えたい場合は、本モデルをベースに LoRA などで対象話者向けにファインチューニングすることを推奨します。
サンプル音声(A/B 比較)
すべて同じ参照音声・同じテキスト・同じサンプリング設定(30 step / linear schedule / euler / seed 固定)で生成。声質はほぼ同等で、差は誤差範囲内と考えています(ベースに比べて若干 speaker similarity が下がる傾向はあります)。
0. おはよう、今日もよろしくね。
ベース (v2):
本モデル (duration control):
1. 深層学習モデルの推論速度は、量子化と蒸留で大幅に改善できる。
ベース (v2):
本モデル (duration control):
2. 桜の花びらが舞い散る中、彼女は静かに微笑んだ。
ベース (v2):
本モデル (duration control):
3. 週末は山に登って、頂上で温かいコーヒーを飲みながら雲海を眺めるのが、何よりの楽しみだ。
ベース (v2):
本モデル (duration control):
クレジット
ベースモデル:
Aratako/Irodori-TTS-500M-v2
ライセンス
Apache-2.0(ベースモデルに準拠)