Views
No views yet
| Checkpoint | Train Hours | Speakers |
|---|---|---|
| ljspeech_vits_ms_istft | 24 | 1 |
| ljspeech_vits_mb_istft | 24 | 1 |
| ljspeech_vits_istft | 24 | 1 |
pip install --upgrade transformers accelerate1from transformers import AutoModel, AutoTokenizer
2import torch
3import numpy as np
4
5model = AutoModel.from_pretrained("anhnct/ljspeech_vits_ms_istft", trust_remote_code=True)
6tokenizer = AutoTokenizer.from_pretrained("anhnct/ljspeech_vits_ms_istft")
7
8text = "Hey, it's Hugging Face on the phone"
9inputs = tokenizer(text, return_tensors="pt")
10
11with torch.no_grad():
12 output = model(**inputs).waveform.wav file:1import scipy
2
3data_np = output.numpy()
4data_np_squeezed = np.squeeze(data_np)
5scipy.io.wavfile.write("techno.wav", rate=model.config.sampling_rate, data=data_np_squeezed)1from IPython.display import Audio
2
3Audio(data_np_squeezed, rate=model.config.sampling_rate)