Dataset tiếng Việt chất lượng cao cho Text-to-Speech (TTS) với 443,641 mẫu audio và transcript được phonemize.
Bộ dữ liệu 1000 giờ này được thiết kế để train từ đầu (from scratch) hoặc finetune các mô hình TTS hoặc ASR với chất lượng cao nhất có thể đạt được hiện nay.
Tuy nhiên, dataset không được mở tải xuống công khai vì lý do bản quyền, kiểm soát chất lượng và yêu cầu về mục đích nghiên cứu.
This dataset is not publicly… See the full description on the dataset page: https://huggingface.co/datasets/pnnbao-ump/VieNeu-TTS-1000h.