Pronunciation Assessment Dataset (BoldVoice + speechocean762)
Dataset for fine-tuning multimodal models on English pronunciation assessment.
Source
Samples
Audio Duration
Description
BoldVoice
38,182
10-20s
Non-native English learners, BoldVoice API annotations
speechocean762
5,000
1.6-20s
Public dataset, 5-expert scored, Mandarin speakers
Total
43,182
Column
Type
Description
audio
Audio (16kHz mono)
Speech… See the full description on the dataset page:
https://huggingface.co/datasets/aigc-x/Pronunciation-boldvoice.