Views
No views yet
pytorch_model.bin weights: CC BY-NC-SA 4.0 (license of the kss dataset)pip install torch torchaudio transformers phonemizerespeak-ng1import torch
2from transformers import AutoModel, AutoTokenizer
3
4repo = "Bingsu/torchaudio_tacotron2_kss"
5model = AutoModel.from_pretrained(
6 repo,
7 trust_remote_code=True,
8 revision="589d6557e8b4bb347f49de74270541063ba9c2bc"
9 )
10tokenizer = AutoTokenizer.from_pretrained(repo)
11model.eval()1vocoder = torch.hub.load("seungwonpark/melgan:aca59909f6dd028ec808f987b154535a7ca3400c", "melgan", trust_repo=True, pretrained=False)
2url = "https://huggingface.co/Bingsu/torchaudio_tacotron2_kss/resolve/main/melgan.pt"
3state_dict = torch.hub.load_state_dict_from_url(url)
4vocoder.load_state_dict(state_dict)1text = "반갑습니다 타코트론2입니다."
2inp = tokenizer(text, return_tensors="pt", return_length=True, return_attention_mask=False)1with torch.inference_mode():
2 out = model(**inp)
3 audio = vocoder(out[0])1import IPython.display as ipd
2
3ipd.Audio(audio[0].numpy(), rate=22050)