Views
No views yet
akera/whisper-large-v3-kin-full model is a fine-tuned version of OpenAI's Whisper-large-v3, specifically adapted for Kinyarwanda Automatic Speech Recognition (ASR). It has been trained on approximately 1400 hours of Kinyarwanda speech data.1git clone https://github.com/SunbirdAI/kinyarwanda-whisper-eval.git
2cd kinyarwanda-whisper-eval
3uv syncuv run python eval.py --model_path akera/whisper-large-v3-kin-full --batch_size=8dev_test[:300] subset:| Model | Hours | WER (%) | CER (%) | Score |
|---|---|---|---|---|
openai/whisper-large-v3 | 0 | 33.10 | 9.80 | 0.861 |
akera/whisper-large-v3-kin-1h-v2 | 1 | 47.63 | 16.97 | 0.754 |
akera/whisper-large-v3-kin-50h-v2 | 50 | 12.51 | 3.31 | 0.932 |
akera/whisper-large-v3-kin-100h-v2 | 100 | 10.90 | 2.84 | 0.943 |
akera/whisper-large-v3-kin-150h-v2 | 150 | 10.21 | 2.64 | 0.948 |
akera/whisper-large-v3-kin-200h-v2 | 200 | 9.82 | 2.56 | 0.951 |
akera/whisper-large-v3-kin-500h-v2 | 500 | 8.24 | 2.15 | 0.963 |
akera/whisper-large-v3-kin-1000h-v2 | 1000 | 7.65 | 1.98 | 0.967 |
akera/whisper-large-v3-kin-full | ~1400 | 7.14 | 1.88 | 0.970 |
Score = 1 - (0.6 × CER + 0.4 × WER)
model.generate with beam search over 300 samples.1@article{Akera2025HowMS,
2 title={How much speech data is necessary for ASR in African languages? An evaluation of data scaling in Kinyarwanda and Kikuyu},
3 author={Benjamin Akera, Evelyn Nafula, Patrick Walukagga, Gilbert Yiga, John Quinn, Ernest Mwebaze},
4 journal={arXiv preprint arXiv:2510.07221},
5 year={2025},
6 url={https://arxiv.org/abs/2510.07221}
7}