A FLORES-200-style dataset extended with additional sentences and
diacritic-stripped variants for robust language identification.
Tab-separated values with columns: __label__ace_Arab, يق أورو سنين، اوق علمون دري فکولتس کدوکترن يونيۏرسيتس ستانفورد ݢڤعموم اکن جتومى الت دياݢنوستيک بارو ڽڠ جوت ݢڤيليه اتو سيل منوروت جنيهجيه: چيڤ اوبيت ڽڠ جوت ݢچيتق ڽڠ جوت ݢڤݢت دڠون ڤرينتر ايڠکجيت ستندر دڠون يوم موڠکين نا سابوه سين ا.س. لم تيڤ سابوه..… See the full description on the dataset page:
https://huggingface.co/datasets/Alegzandra/flores-augmented.