Views
No views yet
ki (ISO 639-1), kik (ISO 639-3)1from transformers import VitsModel, VitsTokenizer
2import torch
3import scipy.io.wavfile
4import numpy as np
5
6# Load model and tokenizer
7model = VitsModel.from_pretrained("BrianMwangi/African-Kikuyu-TTS")
8tokenizer = VitsTokenizer.from_pretrained("BrianMwangi/African-Kikuyu-TTS")
9
10# Example text in Kikuyu
11text = "Mũthenya ũmwe, njũgũ ya ita yakoragwo na atumia a njũri cia kĩrĩra"
12
13# Generate speech
14inputs = tokenizer(text, return_tensors="pt")
15with torch.no_grad():
16 outputs = model(**inputs)
17
18# Save audio file
19audio = outputs.waveform.squeeze().cpu().numpy()
20scipy.io.wavfile.write("kikuyu_speech.wav", rate=model.config.sampling_rate, data=audio)1from transformers import pipeline
2
3# Create TTS pipeline
4tts = pipeline("text-to-speech", model="BrianMwangi/African-Kikuyu-TTS")
5
6# Generate speech
7speech = tts("Mũthenya ũmwe, njũgũ ya ita yakoragwo na atumia a njũri cia kĩrĩra")1@article{pratap2023mms,
2 title={Scaling Speech Technology to 1,000+ Languages},
3 author={Pratap, Vineel and Tjandra, Andros and Shi, Bowen and Tomasello, Paden and Babu, Arun and Kundu, Sayani and Elkahky, Ali and Ni, Zhaoheng and Vyas, Apoorv and Conneau, Alexis and others},
4 journal={arXiv preprint arXiv:2305.13516},
5 year={2023}
6}