Датасет для автоматического распознавания речи (ASR) на чувашском языке —
объединённый корпус, на котором обучалась ASR-модель ChuvashAsr.
Три открытых чувашских речевых корпуса были приведены к единому виду
(16 kHz, mono, PCM_16 WAV), размечены полем source и разбиты на разделы
train / val / test. Всего ≈49.5 часов речи и 37 381 запись.