Final Models - Các Model Text-to-Speech Tiếng Việt
Thư mục này chứa 3 mô hình chuyên biệt cho tổng hợp giọng nói tiếng Việt (TTS - Text-to-Speech). Mỗi model sử dụng kiến trúc khác nhau và có ưu điểm riêng.
Giai đoạn: 3 checkpoint từ các giai đoạn huấn luyện khác nhau
Định dạng: HuggingFace model format
Cách sử dụng
python
1# Sử dụng với HuggingFace Transformers2from transformers import pipeline
34# Chọn từ phase1_best, phase2_best, hoặc phase3_best5model_path ="./Model_vieneu-tts/phase3_best"6tts = pipeline("text-to-speech", model=model_path)78# Tổng hợp giọng nói9output = tts("Xin chào, đây là tiếng Việt")
File quan trọng
hf_bundle_manifest.json: Chi tiết về nguồn gốc và thông tin file cho mỗi checkpoint
🎤 2. Model_vits_finetune
Mô tả
Mô hình VITS được fine-tune chuyên biệt cho tiếng Việt 3 vùng miền (Bắc – Trung – Nam), với tối ưu hóa xử lý ngữ điệu có dấu thông qua pitch contour loss tùy chỉnh.
Cấu trúc thư mục
Model_vits_finetune/
├── README.md # Tài liệu chi tiết cách sử dụng
├── best_model.pth # Trọng số model (PyTorch)
├── config.json # Cấu hình đầy đủ của model
├── speakers.pth # Speaker embedding map cho 3 giọng
└── .gitattributes # Git LFS attributes
Đặc điểm
Kiến trúc: VITS (Variational Inference with adversarial learning)
Framework: Coqui TTS (với custom modifications)
Số giọng: 3 giọng vùng miền (@HUE, @QuangDien, @speaker)
Tối ưu hóa: Pitch contour loss để cải thiện ngữ điệu tiếng Việt có dấu
Độ chính xác: Cao hơn với xử lý tonal đặc biệt
File quan trọng
File
Mô tả
best_model.pth
Trọng số model chính
config.json
Cấu hình huấn luyện và inference
speakers.pth
Embedding các giọng nói
Cách sử dụng
Cài đặt
bash
1pip install TTS
2# Hoặc sử dụng Coqui TTS build custom với pitch contour loss
Mô hình XTTSv2 được fine-tune cho tiếng Việt, dựa trên công nghệ XTTS v2 tiên tiến. Model này tạo ra âm thanh tự nhiên cao với khả năng clone giọng nói.
1pip install git+https://github.com/coqui-ai/TTS.git@xtts
2# hoặc cài đặt XTTSv2 thông thường
Inference
python
1import torch
2from TTS.api import TTS
34# Chọn device5device ="cuda"if torch.cuda.is_available()else"cpu"67# Load model - chọn một trong hai version8model_path ="./Final_models/Model_xtts/fine_tune_goc"9# hoặc10# model_path = "./Final_models/Model_xtts/fine_tune_goc +language_embedding"1112tts = TTS(model_name=model_path, gpu=device=="cuda")1314# Tổng hợp giọng nói15tts.tts_to_file(16 text="Xin chào, đây là mô hình XTTS tiếng Việt",17 file_path="output.wav",18 speaker_wav="reference_speaker.wav"# Optional: để clone giọng19)