Views
No views yet
| File | Size | Quant | Notes |
|---|---|---|---|
outetts-0.3-1b-f16.gguf | 2.4 GB | F16 | Full precision (reference quality) |
outetts-0.3-1b-q8_0.gguf | 1.2 GB | Q8_0 | Recommended — near-lossless quality |
outetts-0.3-1b-q5_k.gguf | 783 MB | Q5_K | Good quality, balanced size |
outetts-0.3-1b-q4_k.gguf | 802 MB | Q4_K | Smallest — verified intelligible (requires CrispASR >= cbe208fa) |
wavtokenizer-decoder-f16.gguf | 130 MB | F16 | WavTokenizer decoder (required companion) |
cbe208fa or later, which fixed a WavTokenizer activation bug (SiLU -> GELU in ResNet blocks) that previously degraded quantized output.1# Build CrispASR
2cmake -S . -B build -DCMAKE_BUILD_TYPE=Release
3cmake --build build -j$(nproc) --target crispasr-cli
4
5# Create a speaker profile from reference audio
6python tools/reference_backends/outetts_create_speaker.py \
7 --audio ref.wav --text "transcript of the reference audio" \
8 --out speaker.json
9
10# Synthesize with voice cloning
11./build/bin/crispasr --backend outetts \
12 -m outetts-0.3-1b-q8_0.gguf \
13 --codec-model wavtokenizer-decoder-f16.gguf \
14 --voice speaker.json \
15 --tts "Hello, how are you today?" \
16 --tts-output hello.wav --seed 421# From HuggingFace model
2python models/convert-outetts-to-gguf.py \
3 --input OuteAI/OuteTTS-0.3-1B \
4 --output outetts-0.3-1b-f16.gguf
5
6python models/convert-wavtokenizer-to-gguf.py \
7 --input OuteAI/wavtokenizer-large-75token-interface \
8 --output wavtokenizer-decoder-f16.gguf
9
10# Quantize
11crispasr-quantize outetts-0.3-1b-f16.gguf outetts-0.3-1b-q8_0.gguf q8_0license: cc-by-4.0, dropping the
NC and SA terms. The upstream checkpoint
OuteAI/OuteTTS-0.3-1B is
CC-BY-NC-SA-4.0, and format conversion does not relax it.