Views
No views yet
stage16_crosslingual_hardcase_x90_4k_20260514best-valid-loss.ptemilianum_step=8,speed=1.10嗯嗯嗯...。。speed=1.10。scripts/infer.py 已经自动封装这些步骤。1git clone https://github.com/piedpiperG/rgad-crosslingual-tts.git
2cd rgad-crosslingual-tts
3
4python -m venv .venv
5source .venv/bin/activate
6pip install -r requirements.txt
7pip install -e .
8
9python scripts/setup_zipvoice.py
10python scripts/download_model.py --output-dir models/rgad-crosslingual-tts
11
12python scripts/infer.py \
13 --model-dir models/rgad-crosslingual-tts \
14 --prompt-wav /path/to/foreign_speaker.wav \
15 --text "这是用外语说话人音色合成的中文语音。" \
16 --output-wav outputs/demo.wav \
17 --gpu 0best-valid-loss.pt:推荐 checkpoint。model.json:ZipVoice 模型结构配置。tokens.txt:Emilia tokenizer 词表。run_config.json:训练配置。train_summary.json:训练摘要。train.jsonl、dev.jsonl、metadata.csv、audio/prompts/*.wav
和 audio/targets/*.wav。可配合 GitHub 仓库中的 scripts/prepare_prefix_manifest.py
构建 prefix fine-tuning manifest。JSONL 每行包含
id、prompt_wav、target_wav、text、prompt_language、target_language
和 speaker_id,音频路径相对数据集根目录。docs/paper_assets/stage21_main_text_20260520 主表。
所有系统使用相同 prompt audio、目标文本、ASR、SIM-o、UTMOS 和 RTF 评测协议;目标语言为中文,因此主要看 CER。| 系统 | 样本数 | CER ↓ | SIM-o ↑ | UTMOS ↑ | RTF ↓ |
|---|---|---|---|---|---|
| Original compact model | 946 | 51.31% | 0.551 | 2.988 | 0.0548 |
| F5-TTS | 946 | 21.22% | 0.526 | 2.699 | 0.1364 |
| IndexTTS2 | 946 | 3.68% | 0.667 | 2.979 | 0.9580 |
| Fish Audio S2 | 946 | 7.25% | 0.642 | 3.516 | 0.5104 |
| CosyVoice3 | 946 | 20.80% | 0.674 | 3.338 | 0.5705 |
| RGAD-TTS release | 946 | 13.70% | 0.512 | 3.244 | 0.0565 |
| Reference target audio | 946 | 4.15% | 0.066 | 2.727 | - |
| 系统 | 样本数 | CER ↓ | SIM-o ↑ | UTMOS ↑ | RTF ↓ |
|---|---|---|---|---|---|
| Original compact model | 425 | 49.10% | 0.488 | 2.662 | 0.0672 |
| F5-TTS | 425 | 54.81% | 0.426 | 1.939 | 0.0626 |
| IndexTTS2 | 425 | 2.87% | 0.509 | 2.546 | 1.4839 |
| Fish Audio S2 | 425 | 169.91% | 0.605 | 3.631 | 0.5035 |
| CosyVoice3 | 425 | 105.95% | 0.563 | 3.335 | 0.4570 |
| RGAD-TTS release | 425 | 3.38% | 0.453 | 2.630 | 0.0564 |
| Podcast target audio | 425 | 2.67% | 0.501 | 2.535 | - |