Views
No views yet
1from transformers import VitsModel, AutoTokenizer
2import torch
3import scipy
4
5model = VitsModel.from_pretrained("joefox/tts_vits_ru_hf")
6tokenizer = AutoTokenizer.from_pretrained("joefox/tts_vits_ru_hf")
7
8text = "Привет, как дел+а? Всё +очень хорош+о! А у тебя как?"
9text = text.lower()
10inputs = tokenizer(text, return_tensors="pt")
11inputs['speaker_id'] = 3
12
13with torch.no_grad():
14 output = model(**inputs).waveform
15
16scipy.io.wavfile.write("techno.wav", rate=model.config.sampling_rate, data=output[0].cpu().numpy())1from IPython.display import Audio
2
3Audio(output, rate=model.config.sampling_rate)