Views
No views yet
conda create -n paraspeechcaps python=3.11), but most other versions should probably work.1git clone https://github.com/ajd12342/paraspeechcaps.git
2cd paraspeechcaps/model/parler-tts
3pip install -e .[train]1import torch
2from parler_tts import ParlerTTSForConditionalGeneration
3from transformers import AutoTokenizer
4import soundfile as sf
5
6device = "cuda:0" if torch.cuda.is_available() else "cpu"
7model_name = "ajd12342/parler-tts-mini-v1-paraspeechcaps"
8guidance_scale = 1.5
9
10model = ParlerTTSForConditionalGeneration.from_pretrained(model_name).to(device)
11description_tokenizer = AutoTokenizer.from_pretrained(model_name)
12transcription_tokenizer = AutoTokenizer.from_pretrained(model_name, padding_side="left")
13
14input_description = "In a clear environment, a male voice speaks with a sad tone.".replace('\n', ' ').rstrip()
15input_transcription = "Was that your landlord?".replace('\n', ' ').rstrip()
16
17input_description_tokenized = description_tokenizer(input_description, return_tensors="pt").to(model.device)
18input_transcription_tokenized = transcription_tokenizer(input_transcription, return_tensors="pt").to(model.device)
19
20generation = model.generate(input_ids=input_description_tokenized.input_ids, prompt_input_ids=input_transcription_tokenized.input_ids, guidance_scale=guidance_scale)
21
22audio_arr = generation.cpu().numpy().squeeze()
23sf.write("output.wav", audio_arr, model.config.sampling_rate)1@misc{diwan2025scalingrichstylepromptedtexttospeech,
2 title={Scaling Rich Style-Prompted Text-to-Speech Datasets},
3 author={Anuj Diwan and Zhisheng Zheng and David Harwath and Eunsol Choi},
4 year={2025},
5 eprint={2503.04713},
6 archivePrefix={arXiv},
7 primaryClass={eess.AS},
8 url={https://arxiv.org/abs/2503.04713},
9}