Views
No views yet
lr=1e-7, epochs=6, batch_size=1, grad_acc=41pip install -U qwen-tts
2pip install -U flash-attn --no-build-isolation # 可选,降低显存占用1import torch
2import soundfile as sf
3from qwen_tts import Qwen3TTSModel
4
5# 加载模型
6model = Qwen3TTSModel.from_pretrained(
7 "fangzny/xiadie-qwen3tts-12hz-1.7b",
8 device_map="cuda:0",
9 dtype=torch.bfloat16,
10 attn_implementation="sdpa", # 或 "flash_attention_2"
11)
12
13# 使用默认遐蝶参考音频
14ref_audio = "ref_audio/xiadie_gold_standard.wav"
15ref_text = "冷么?要不要一起去日光下走走?"
16
17wavs, sr = model.generate_voice_clone(
18 text="今日はいい天気ですね、一緒に散歩に行きませんか?",
19 language="Japanese",
20 ref_audio=ref_audio,
21 ref_text=ref_text,
22 temperature=0.7,
23 top_p=0.9,
24 top_k=50,
25 repetition_penalty=1.2,
26)
27sf.write("output.wav", wavs[0], sr)ref_audio 为任意遐蝶角色的音频文件(建议 3-10 秒,清晰无背景噪音),并传入对应的 ref_text 文本来克隆不同的音色。| 参数 | 推荐值 | 说明 |
|---|---|---|
temperature | 0.7 | 越高越有变化但可能出错 |
top_p | 0.9 | 采样概率阈值 |
top_k | 50 | 采样候选集大小 |
repetition_penalty | 1.2 | 防止循环复读 |