This dataset is designed for training real-time (streaming) ASR models, with a focus on handling chunk-based audio processing. It contains standardized audio segments from LibriSpeech dev-clean, processed for streaming ASR applications.
Dataset Description
Dataset Summary
Source: LibriSpeech dev-clean
Total chunks: 2,703
Total duration: ~20 hours (1,212.26 seconds)
Unique speakers: 40
Audio format: 16 kHz mono WAV
Language: English… See the full description on the dataset page: https://huggingface.co/datasets/orgh0/openwhisper.