THCHS-30 test split for Mandarin Chinese speech recognition benchmarking.
Language: Mandarin Chinese (zh-CN)
Samples: 2,495
Speakers: 10
Sample Rate: 16 kHz
License: Apache 2.0
from datasets import load_dataset
After uploading to HuggingFace
dataset = load_dataset("your-username/thchs30-test")
Example
print(dataset['train'][0])
{
'audio': {'array': [...], 'sampling_rate': 16000, 'path': 'audio/D11_750.wav'},