Views
No views yet
WER:30.41 CER: 20.221import asrp
2import nlp2
3import IPython.display as ipd
4from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
5nlp2.download_file(
6 'https://dl.fbaipublicfiles.com/fairseq/speech_to_speech/vocoder/code_hifigan/mhubert_vp_en_es_fr_it3_400k_layer11_km1000_lj/g_00500000',
7 './')
8
9
10tokenizer = AutoTokenizer.from_pretrained("voidful/mhubert-unit-tts")
11model = AutoModelForSeq2SeqLM.from_pretrained("voidful/mhubert-unit-tts")
12model.eval()
13cs = asrp.Code2Speech(tts_checkpoint='./g_00500000', vocoder='hifigan')
14
15inputs = tokenizer(["The quick brown fox jumps over the lazy dog."], return_tensors="pt")
16code = tokenizer.batch_decode(model.generate(**inputs,max_length=1024))[0]
17code = [int(i) for i in code.replace("</s>","").replace("<s>","").split("v_tok_")[1:]]
18print(code)
19ipd.Audio(data=cs(code), autoplay=False, rate=cs.sample_rate)