Views
No views yet
model_ep7.pth (Alias: model.pth) — im Hörvergleich gegenüber Epoche 5, 9 und 10
favorisiert, bei nahezu identischem Validation-Loss (0.291 vs. 0.290 bei Epoche 9/10).
Alle 10 Epochen liegen im Repo, jeweils mit eigenem Voicepack, falls du selbst
vergleichen möchtest.| Epoche | Val-Loss | Dur-Loss | F0-Loss |
|---|---|---|---|
| 1 | 0.326 | 0.499 | 2.529 |
| 2 | 0.327 | 0.474 | 2.520 |
| 3 | 0.327 | 0.473 | 2.550 |
| 4 | 0.298 | 0.474 | 2.524 |
| 5 | 0.301 | 0.469 | 2.487 |
| 6 | 0.295 | 0.452 | 2.561 |
| 7 | 0.291 | 0.476 | 2.530 |
| 8 | 0.292 | 0.468 | 2.449 |
| 9 | 0.290 | 0.457 | 2.501 |
| 10 | 0.290 | 0.473 | 2.505 |
inference.py ist eigenständig — es lädt Modell, Config und Voicepack automatisch von
diesem Repo herunter, es sind keine lokalen Dateien oder ein Checkout des Trainings-Repos
nötig.1pip install torch soundfile numpy huggingface_hub
2
3# Wichtig: kokoro-Fork zuerst installieren, danach den misaki-Fork mit --force-reinstall --no-deps,
4# da die kokoro-Installation sonst den misaki-Fork mit der PyPI-Standardversion
5# überschreibt (die kein deutsches G2P-Modul enthält).
6pip install git+https://github.com/semidark/kokoro.git
7pip install --force-reinstall --no-deps git+https://github.com/semidark/misaki.git@6d252a2e1# Empfohlener Checkpoint (Epoche 7)
2python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav
3
4# Explizit eine andere Epoche wählen
5python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav ep10
6python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav ep3