Views
No views yet
checkpoint_0.pt(中英日 約600時間で学習された 31.6M パラメータの flow-matching + DiT モデル)1from api import StableTTSAPI
2
3model = StableTTSAPI(
4 './checkpoints/checkpoint_200.pt',
5 './vocoders/pretrained/firefly-gan-base-generator.ckpt',
6 'ffgan',
7).to('cuda')
8audio, _ = model.inference(
9 'こんにちは、今日はいい天気ですね。',
10 'reference.wav', # 参照音声(つくよみちゃんコーパスの任意の1発話など)
11 'japanese', step=16, temperature=1.0, length_scale=1.0,
12 solver='euler', cfg=3.0, sway_coef=-1.0, cfg_rescale=0.7,
13)推奨推論設定(2026-07 更新):solver='euler', step=16, sway_coef=-1.0, cfg_rescale=0.7。Sway Sampling(F5-TTS 由来)により euler 16 ステップで従来のdopri525 ステップと同等以上の音質を約10倍高速に得られます(事前学習モデルでの A/B で dopri5-25 との mel-L1=0.078・CER/話者類似性ほぼ同等を確認。サンプリング設定なので fine-tune モデルにもそのまま適用できます)。cfg_rescaleは過剰ガイダンスによる飽和を抑える微調整です。sway_coef/cfg_rescaleは最新の StableTTSEx が必要で、従来設定(solver='dopri5', step=25)でも動作します。
VOICEACTRESS100_001.wav、step=25 / dopri5 / cfg=3.0)。samples/ ディレクトリにあります。