Views
No views yet
ta) using the Mozilla Common Voice dataset. It improves Tamil text-to-speech generation by adapting the base multilingual model to the specific phonetics and characteristics of Tamil language data.1
2
3# Load model directly
4from transformers import AutoTokenizer, AutoModelForTextToWaveform
5
6tokenizer = AutoTokenizer.from_pretrained("Lingalingeswaran/facebook_mms_tamil")
7model = AutoModelForTextToWaveform.from_pretrained("Lingalingeswaran/facebook_mms_tamil")
8
9
10
11# Input text
12import torch # import torch here
13from scipy.io.wavfile import write # import write here
14from IPython.display import Audio # Only if you're using Jupyter
15text = "இந்த மாணவர்கள் எப்போதும் இப்படித்தான்"
16inputs = tokenizer(text, return_tensors="pt")
17
18# Generate waveform
19with torch.no_grad():
20 output = model(**inputs).waveform
21
22# Save waveform to a file
23waveform = output.squeeze().cpu().numpy()
24write("tamil_output.wav", rate=16000, data=waveform) # 16kHz sample rate
25
26# (Optional) Play audio in Jupyter Notebook
27Audio("tamil_output.wav")