Views
No views yet
| Base Model | facebook/mms-tts-kik |
| Architecture | VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) |
| Language | Kikuyu (kik) — Bantu, tonal language |
| Parameters | ~36M |
| Training Data | 48,500 audio samples from ANV + WAXAL datasets |
| Training | GAN-based adversarial fine-tuning on A100 80GB GPU |
| Developer | C-elo Labs |
| Dataset | Samples | Description |
|---|---|---|
| ANV (African Next Voices) | ~46,900 | Scripted Kikuyu speech across 5 dialects |
| WAXAL (Google) | ~1,600 | Studio-quality TTS recordings |
1from transformers import VitsModel, AutoTokenizer
2import torch
3import scipy.io.wavfile as wavfile
4
5model = VitsModel.from_pretrained("gateremark/kikuyu-tts-v1")
6tokenizer = AutoTokenizer.from_pretrained("gateremark/kikuyu-tts-v1")
7
8text = "ũhoro waku"
9inputs = tokenizer(text=text, return_tensors="pt")
10
11with torch.no_grad():
12 output = model(**inputs)
13
14waveform = output.waveform[0].numpy()
15wavfile.write("output.wav", model.config.sampling_rate, waveform)1@misc{gatere2026kikuyutts,
2 title={Fine-tuned Kikuyu TTS based on MMS-TTS},
3 author={Mark Gatere},
4 year={2026},
5 publisher={C-elo Labs},
6 url={https://huggingface.co/gateremark/kikuyu-tts-v1}
7}