Views
No views yet
pip install --upgrade pip
pip install --upgrade transformers g2p-en1
2from transformers import FastSpeech2ConformerTokenizer, FastSpeech2ConformerWithHifiGan
3import soundfile as sf
4
5tokenizer = FastSpeech2ConformerTokenizer.from_pretrained("espnet/fastspeech2_conformer")
6inputs = tokenizer("Hello, my dog is cute.", return_tensors="pt")
7input_ids = inputs["input_ids"]
8
9model = FastSpeech2ConformerWithHifiGan.from_pretrained("espnet/fastspeech2_conformer_with_hifigan")
10output_dict = model(input_ids, return_dict=True)
11waveform = output_dict["waveform"]
12
13sf.write("speech.wav", waveform.squeeze().detach().numpy(), samplerate=22050)