Views
No views yet
| 项目 | 值 |
|---|---|
| 基础模型 | Qwen3-TTS-12Hz-0.6B-Base |
| 训练数据 | Common Voice Uyghur v24 (14,211 样本) |
| 说话人 | uyghur_speaker |
| 采样率 | 24000 Hz |
| 训练步数 | 4000 steps |
| 最终 Loss | ~4.5 |
1from qwen_tts import Qwen3TTSModel
2import soundfile as sf
3import torch
4
5# 加载模型
6tts = Qwen3TTSModel.from_pretrained(
7 "anke01/qwen3-tts-uyghur",
8 device_map="cuda:0",
9 dtype=torch.bfloat16,
10)
11
12# 合成语音
13wavs, sr = tts.generate_custom_voice(
14 text="بۇ بىر سىناق ئاۋازى.",
15 speaker="uyghur_speaker",
16 language="Auto",
17)
18
19# 保存
20sf.write("output.wav", wavs[0], sr)
21print(f"Saved: {len(wavs[0])/sr:.2f}s at {sr}Hz")1# 下载模型
2git lfs install
3git clone https://huggingface.co/anke01/qwen3-tts-uyghur
4
5# 推理
6cd qwen3-tts-uyghur
7python infer.py \
8 --model_path ./checkpoint-step-4000 \
9 --text "بۇ بىر سىناق ئاۋازى." \
10 --speaker uyghur_speaker \
11 --output test.wav| 参数 | 值 |
|---|---|
| Batch Size | 2 |
| Gradient Accumulation | 16 |
| Learning Rate | 2e-6 |
| Max Steps | 4000 |
| Epoch | 0 (55%) |
qwen3-tts-uyghur/
├── checkpoint-step-4000/ # 微调模型权重
│ ├── config.json
│ ├── model.safetensors # 1.8GB
│ ├── tokenizer_config.json
│ ├── vocab.json
│ ├── merges.txt
│ └── speech_tokenizer/
├── train.py # 训练脚本
├── infer.py # 推理脚本
├── dataset.py # 数据集类
├── prepare_data.py # 数据预处理
├── convert_commonvoice_to_jsonl.py
├── requirements.txt
└── README.md1{
2 "audio": "path/to/audio.wav",
3 "text": "维吾尔语文本",
4 "ref_audio": "path/to/reference.wav",
5 "audio_codes": [[...], [...]]
6}pip install -r requirements.txtqwen-tts==0.1.1
transformers>=4.57.3
accelerate>=0.25.0
torch>=2.0.0
torchaudio>=2.0.0
librosa>=0.10.0
soundfile>=0.12.0
tqdm>=4.66.0
safetensors>=0.4.0بۇ بىر سىناق ئاۋازى. # 这是一个测试声音
ياخشىمۇسىز، بۈگۈن ھاۋا ياخشى. # 你好,今天天气好
ئىككىنچى سىناق. # 第二个测试1@misc{qwen3tts2025,
2 title={Qwen3-TTS: A Multilingual Multimodal TTS Model},
3 author={Qwen Team},
4 year={2025},
5 url={https://github.com/QwenLM/Qwen3-TTS}
6}