Views
No views yet
1from transformers import VitsModel, AutoTokenizer, AutoFeatureExtractor
2import torch, soundfile as sf
3
4model_id = "hamza-amin/mms-tts-urd-fine-tuned"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7feature_extractor = AutoFeatureExtractor.from_pretrained(model_id)
8model = VitsModel.from_pretrained(model_id)
9
10inputs = tokenizer("میں اردو بول سکتا ہوں۔", return_tensors="pt")
11
12with torch.no_grad():
13 output = model(**inputs)
14
15sf.write(
16 "output.wav",
17 output.waveform.squeeze().numpy(),
18 feature_extractor.sampling_rate
19)finetune-hf-vits1@article{pratap2023mms,
2 title={Scaling Speech Technology to 1,000+ Languages},
3 author={Pratap et al.},
4 journal={arXiv preprint arXiv:2305.13516},
5 year={2023}
6}