Views
No views yet
1from transformers import VitsModel, VitsMmsTokenizer
2import torch
3
4model = VitsModel.from_pretrained("Matthijs/mms-tts-kor")
5tokenizer = VitsMmsTokenizer.from_pretrained("Matthijs/mms-tts-kor")
6
7text = "some example text in the Korean language"
8inputs = tokenizer(text, return_tensors="pt")
9
10with torch.no_grad():
11 output = model(**inputs)
12
13from IPython.display import Audio
14Audio(output.audio[0], rate=16000)@article{pratap2023mms,
title={Scaling Speech Technology to 1,000+ Languages},
author={Vineel Pratap and Andros Tjandra and Bowen Shi and Paden Tomasello and Arun Babu and Sayani Kundu and Ali Elkahky and Zhaoheng Ni and Apoorv Vyas and Maryam Fazel-Zarandi and Alexei Baevski and Yossi Adi and Xiaohui Zhang and Wei-Ning Hsu and Alexis Conneau and Michael Auli},
journal={arXiv},
year={2023}
}