Views
No views yet
| Field | Value |
|---|---|
| Model ID | alakxender/mms-tts-div-finetuned-md-m01 |
| Base Architecture | MMS-TTS (VITS) |
| Language | Divehi (dv) |
| Voice | Male |
| Sampling Rate | 16 kHz |
| Tokenizer | VITSTokenizer |
| Inference Engine | Transformers (🤗 Hugging Face) |
1from transformers import VitsModel, VitsTokenizer
2import torchaudio
3
4tokenizer = VitsTokenizer.from_pretrained("alakxender/mms-tts-div-finetuned-md-m01")
5model = VitsModel.from_pretrained("alakxender/mms-tts-div-finetuned-md-m01")
6
7text = "މޫސުން ވަރަށް ގޯސްވެ، ފުވައްމުލަކުން ފެށިގެން އައްޑުއަށް އޮރެންޖް އެލާޓް ނެރެފި"
8inputs = tokenizer(text, return_tensors="pt")
9waveform = model.generate(**inputs).waveform[0]
10
11torchaudio.save("output.wav", waveform.unsqueeze(0), 16000)alakxender/mms-tts-div-finetuned-md-m013.228
1{
2 "5": "Excellent (very natural)",
3 "4": "Good (mostly natural)",
4 "3": "Fair (some robotic quality)",
5 "2": "Poor (noticeably unnatural)",
6 "1": "Bad (unintelligible or very synthetic)"
7}outputs/audio/outputs/spectrograms/outputs/report.txtoutputs/mos_scores.txt