Views
No views yet
| Métrique | Valeur |
|---|---|
| Epochs | 100 |
| Batch Size | 4 |
| Learning Rate | 2e-6 |
| Loss Initiale | 2.221 |
| Loss Finale | 0.0166 |
| Amélioration | 99.25% (133x réduction) |
| Dataset | 16 fichiers audio (~42 minutes) |
| Modèle | Loss Finale | Amélioration |
|---|---|---|
| Baseline | 0.102 | - |
| Optimisé | 0.0166 | 83.7% meilleur |
1import torch
2from TTS.tts.configs.xtts_config import XttsConfig
3from TTS.tts.models.xtts import Xtts
4
5# Charger la configuration
6config = XttsConfig()
7config.load_json("config.json")
8
9# Charger le modèle
10model = Xtts.init_from_config(config)
11model.load_checkpoint(
12 config,
13 checkpoint_path="best_model.pth",
14 vocab_path="vocab.json",
15 eval=True,
16 use_deepspeed=False
17)
18
19# Générer de l'audio
20if torch.cuda.is_available():
21 model.cuda()
22
23outputs = model.synthesize(
24 "Votre texte ici",
25 config,
26 speaker_wav="path/to/reference_audio.wav",
27 language="fr",
28 gpt_cond_len=6,
29 temperature=0.75,
30)best_model.pth (5.3 GB) - Poids du modèle optimiséconfig.json - Configuration du modèlevocab.json - Vocabulaire du tokenizerdvae.pth - DVAE checkpointmel_stats.pth - Statistiques de normalisation