Views
No views yet
tools/omni/voxcpm2).| File | Format | Size | Component |
|---|---|---|---|
VoxCPM2-BaseLM-F16.gguf | F16 | ~3.0 GB | Base language model (28-layer, n_embd=2048) |
VoxCPM2-BaseLM-Q8_0.gguf | Q8_0 | ~1.6 GB | Base language model, 8-bit quantized (recommended) |
VoxCPM2-Acoustic-F16.gguf | F16 | ~1.7 GB | Acoustic stack (ResidualLM + FSQ + LocEnc/LocDiT CFM + AudioVAE) |
1git clone https://github.com/tc-mb/llama.cpp-omni.git
2cd llama.cpp-omni1# macOS (Metal — auto-detected):
2cmake -B build -DCMAKE_BUILD_TYPE=Release
3cmake --build build --target voxcpm2-cli -j
4
5#Linux / Windows (CUDA):
6cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
7cmake --build build --target voxcpm2-cli -j
8
9# Linux / Windows (Vulkan):
10cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_VULKAN=ON
11cmake --build build --target voxcpm2-cli -j
12
13# CPU only:
14cmake -B build -DCMAKE_BUILD_TYPE=Release
15cmake --build build --target voxcpm2-cli -j1# Download Q8_0 (recommended)
2huggingface-cli download DennisHuang648/VoxCPM2-
3 VoxCPM2-BaseLM-Q8_0.gguf VoxCPM2-Acoustic-F16.gguf \
4 --local-dir ./models
5
6# Or download F16 (full precision)
7huggingface-cli download DennisHuang648/VoxCPM2-GGUF \
8 VoxCPM2-BaseLM-F16.gguf VoxCPM2-Acoustic-F16
9 --local-dir ./modelsvoxcpm2-cli from llama.cpp-omni, then:1# Basic TTS (GPU by default; add --cpu to force CPU)
2./voxcpm2-cli \
3 -t "Hello, this is VoxCPM2 running through llama.cpp-omni." \
4 -o output.wav \
5 VoxCPM2-BaseLM-F16.gguf \
6 VoxCPM2-Acoustic-F16.gguf
7
8# Voice cloning (reference audio)
9./voxcpm2-cli -t "Cloned voice." -r speaker.wav -o clone.wav \
10 VoxCPM2-BaseLM-F16.gguf VoxCPM2-Acoustic-F16.gguf
11
12# Reference-transcript ("ultimate") cloning
13./voxcpm2-cli -t "Target text." --prompt-wav speaker.wav --prompt-text "transcript of speaker.wav" \
14 -o clone.wav VoxCPM2-BaseLM-F16.gguf VoxCPM2-Acoustic-F16.gguf--cfg (guidance scale, default 2.0), --timesteps (CFM steps, default 10),
--seed, --temperature, --stream. Voice design: prefix the text with
(a calm female voice)….1python tools/omni/voxcpm2/convert_voxcpm2_to_gguf.py \
2 --model model.safetensors \
3 --vae audiovae.pth \
4 --config config.json \
5 --output ./out