Views
No views yet

Tất cả các mẫu âm thanh tiếng Việt dưới đây đều được sinh ra (inferred) từ mô hình Kani TTS Vie.
"Cũng trong thập niên 1960, Jones quyết định đương đầu với một thử thách mới, viết nhạc phim."
"Ông biết hiện giờ nhiều người không còn thích đọc sách nữa, thế nên dù ai đó chỉ vô tình ghé hiệu sách, ông cũng đều trân trọng cả."
"Đi vào chi tiết Làm việc nhóm và tính cứng nhắc cá nhân là hai điều không thể nào tương thích với nhau."
💡 Lưu ý: Các bạn hoàn toàn có thể dùng giọng của những ngôn ngữ khác để inference cho tiếng Việt!
"Ngược lại, những người không thể đào tạo sẽ gặp khó khăn với sự thay đổi và kết quả là họ không thể thích nghi."
"Những người này sẽ vò đầu bứt tai, chịu đựng nỗi đau thể chất khi nghĩ đến chuyện làm những điều khác biệt."
finetune/ trong repository này để tìm các Notebook hướng dẫn chi tiết:
🔗 https://github.com/pnnbao97/Kani-TTS-Vie1# Clone repository
2git clone https://github.com/pnnbao97/Kani-TTS-Vie.git
3cd Kani-TTS-Vie
4
5# Cài đặt dependencies
6uv sync
7
8# Chạy ứng dụng
9uv run uvicorn server:app1from kani_vie.tts_core import Config, KaniModel, NemoAudioPlayer
2from utils.normalize_text import VietnameseTTSNormalizer
3
4# Khởi tạo model
5config = Config()
6player = NemoAudioPlayer(config)
7kani = KaniModel(config, player)
8normalizer = VietnameseTTSNormalizer()
9
10# Tạo giọng nói
11text = "Xin chào! Tôi là Kani TTS."
12processed_text = normalizer.normalize(text)
13audio, _ = kani.run_model(processed_text, speaker_id="nam-mien-nam")
14
15# Lưu file
16import soundfile as sf
17sf.write("output.wav", audio, 22050)| Thông số | Giá trị |
|---|---|
| Model size | 370M parameters |
| Sample rate | 22,050 Hz |
| Inference time | ~3s cho văn bản ngắn |
| RTF | ~0.1-0.3x (real-time factor) |
| Base model | nineninesix/kani-tts-370m |