Mush dataset
An audio–transcription alignment dataset for the Mush dialect of Armenian.
It contains approximately 4.5 hours of speech distributed across three splits:
Train: 4,830 samples
Validation (Dev): 117 samples
Test: 650 samples
Content
Each example includes:
audio: a WAV audio file
transcription: the Armenian transcription text
duration: audio duration in seconds