Vietnam-Celeb Speaker Recognition with ECAPA-TDNN
Dự án này thực hiện fine-tuning mô hình ECAPA-TDNN trên tập dữ liệu tiếng Việt (Vietnam-Celeb).
🚀 Kết quả đạt được
Sau khi áp dụng chuỗi tối ưu hóa, hệ thống đạt được hiệu năng vượt trội:
- Base Model (Pretrained): 17.83% EER
- Fine-tuned (Epoch 10): 14.87% EER
- Optimized (VAD + Multi-Enrollment): 5.81% EER
🛠 Cấu trúc thư mục quan trọng
training/: Chứa các script huấn luyện và đánh giá.
src/speaker/: Core logic trích xuất embedding và so sánh profile.
checkpoints/: Lưu trữ trọng số mô hình tối ưu.
📦 Hướng dẫn sử dụng
- Cài đặt SpeechBrain:
pip install speechbrain
- Sử dụng mô hình thông qua API
huggingface_hub hoặc thư viện speechbrain.
📝 Ghi chú về kỹ thuật
Chúng tôi chọn Epoch 10 là điểm dừng tối ưu để tránh hiện tượng Overfitting, kết hợp với kỹ thuật tạo Speaker Centroid từ 5 mẫu ghi âm khác nhau để tăng độ tin cậy.