Views
No views yet
1import torch
2import scipy.io.wavfile as wavfile
3from vits2_engine import VITS2Engine
4
5# Load the model
6engine = VITS2Engine(model_dir="path/to/vits2-claude")
7
8# Generate speech
9wav = engine.tts("moien, wéi geet et dir?")
10
11# Save to file
12wavfile.write("output.wav", engine.sample_rate, wav)1python inference.py "moien, wéi geet et dir?"
2
3# With custom parameters
4python inference.py "Text" --noise_scale 0.5 --length_scale 1.1 -o output.wavnoise_scale: Controls voice variation (default: 0.667, lower = more consistent)noise_scale_w: Controls duration variation (default: 0.8)length_scale: Controls speech speed (default: 1.0, higher = slower)| Parameter | Value |
|---|---|
| Hidden Channels | 192 |
| Filter Channels | 768 |
| Attention Heads | 2 |
| Encoder Layers | 6 |
| Mel Channels | 80 |
| FFT Size | 1024 |
| Hop Length | 256 |
1@misc{zls2025vits2claude,
2 title={VITS2 Claude - Luxembourgish Gender-Neutral Voice},
3 author={Zenter fir d'Lëtzebuerger Sprooch},
4 year={2025},
5 publisher={Hugging Face},
6 url={https://huggingface.co/ZLSCompLing/VITS2-Claude}
7}https://lod.lu/uploads/examples/AAC/{folder}/{id}.m4a{folder} is the first 2 characters of {id}.