Lori dataset
An audio–transcription alignment dataset for the Lori dialect of Armenian.
It contains approximately 4.5 hours of speech distributed across three splits:
Train: 4,340 samples
Validation (Dev): 90 samples
Test: 580 samples
Content
Each example includes:
audio: a WAV audio file
transcription: the Armenian transcription text
duration: audio duration in seconds