Views
No views yet
1import os
2import torchaudio
3from transformers import AutoModel, AutoProcessor
4
5processor = AutoProcessor.from_pretrained("MCplayer/MOSS-TTSD-v0.5", codec_path="MCplayer/XY_Tokenizer", trust_remote_code=True)
6model = AutoModel.from_pretrained("MCplayer/MOSS-TTSD-v0.5", trust_remote_code=True, device_map="auto").eval()
7
8data = [{
9 "base_path": "/path/to/data/",
10 "text": "跟踪他们,他俩不行,从屋上平安下来没有扭伤脖子,",
11 "system_prompt": "你是一个根据文本生成对应音频的语音合成器。",
12 "prompt_text": "这支史诗级的美国迷幻摇滚乐队创建于,",
13 "prompt_audio": "examples/prompt.wav",
14}]
15
16inputs = processor(data)
17token_ids = model.generate(input_ids=inputs["input_ids"], attention_mask=inputs["attention_mask"])
18text, audios = processor.batch_decode(token_ids)
19
20if not os.path.exists("outputs/"):
21 os.mkdir("outputs/")
22for i, data in enumerate(audios):
23 for j, fragment in enumerate(data):
24 torchaudio.save(f"outputs/audio_{i}_{j}.wav", fragment.cpu(), 24000)
25