Views
No views yet
k2-fsa/OmniVoice —
a massively multilingual (600+ languages) zero-shot TTS built on a single-stage
NAR discrete-diffusion architecture (Qwen3 backbone run bidirectionally) with a
Higgs-audio v2 codec.| File | What |
|---|---|
model.safetensors | Qwen3 backbone (llm.*) + audio embeddings + 8 codebook heads |
audio_tokenizer/model.safetensors | Higgs-audio v2 codec (semantic wav2vec2 + acoustic DAC RVQ) |
tokenizer.json, config.json, chat_template.jinja | Qwen3 text tokenizer + config |