Multilingual Language Identification (LID) Evaluation Dataset
Developed by Kotibai & Rubai Team (@islomov)
A balanced multilingual speech dataset for training and evaluating language identification models.
This dataset combines audio samples from three major multilingual speech corpora:
Common Voice 17 (Mozilla) - Crowdsourced read speech with transcriptions
FLEURS (Google) - Professional recordings in 102 languages
VoxLingua107 -… See the full description on the dataset page:
https://huggingface.co/datasets/Kotib/eval_lang_id_multilingual_99.