This dataset is produced from pykeio/librivox-tracks with single-reader filtering and Silero VAD segmentation.
data/train-*.parquet: all utterances (split is always train), collected until a global total audio budget is reached (see run manifest / script args: (2442/5994)*3600 * multiplier seconds by default).
Each row stores source metadata plus a mono WAV payload (audio_bytes) and sampling_rate.