This dataset contains continuous speech audio files for various languages (ranging from 5 to 30 minutes in length per language) collected from diverse sources including Hugging Face and YouTube.
Dataset Statistics
Total Languages: 100
Sources: HF Omnilingual ASR Corpus, YouTube
Language Details
Language Code
Language Name
Source
Duration (seconds)