Hola: Multilingual-Text-Generation-(LLM) and Language-Classification-Public-Dataset
Release Date: 2/12/2024 (Myanmar Union Day)
Overview
Hola dataset contains data from 11 languages, including English, Burmese, Japanese, Spanish, Chinese (Traditional), Korean, Mon, Paoh, etc. And the data was crawled from Wikipedia. Each sample is a sentence data with a label of ISO 639-1 code of respective language, e.g. en, my, ja, es, zh, ko, etc.