Decoder-only transformer TTS, using
WavTokenizer
as the audio codec.
1git clone https://github.com/FirstPotatoCoder/SimpleTTS.git
2cd SimpleTTS
3bash setup.sh
4python scripts/download_weights.py
1from tts.inference import TTSPipeline
2
3pipe = TTSPipeline(
4tts_weights="weights/tts.pt",
5wavtokenizer_weights="weights/wavtokenizer.ckpt",
6wavtokenizer_config="configs/wavtokenizer_config.yaml",
7)
8pipe.generate("Some text to speak.", out_path="out.wav")
Audio tokenizer/codec:
WavTokenizer
(vendored under
wavtokenizer/, trimmed to inference-only code).
Data synthesis:
Kokoro, used to generate ~100 hours
of synthetic audio for training this TTS model.
Text phonemization:
espeak-ng, used to
convert input text into phonemes.