Combined Thai audio dataset from multiple sources
Total samples: 20
Total duration: 0.02 hours
Language: Thai (th)
Audio format: 16kHz mono WAV
Volume normalization: -20dB
Processed 1 datasets in streaming mode
GigaSpeech2: Large-scale multilingual speech corpus
from datasets import load_dataset
Load with streaming to avoid downloading everything