KenCorpus Audio: A Kenyan Multilingual Spontaneous Speech Corpus
Dataset Description
KenCorpus Audio is a multilingual spontaneous speech corpus for Kenyan languages. The recordings capture natural, unscripted speech from native speakers in their communities across diverse topics including culture, agriculture, commerce, health, and daily life.
Three languages were selected: Kiswahili, Luhya (dialects: Lumarachi, Logooli, Lubukusu), and Dholuo.
Dataset… See the full description on the dataset page: https://huggingface.co/datasets/Kencorpus/KenCorpus_audio.