Views
No views yet
1local_models/
2├── aligner/
3│ └── Qwen3-ForcedAligner-0.6B/
4├── assets/
5│ └── dualcodec_silence_2s.pt
6├── dualcodec/
7│ ├── dualcodec_ckpts/
8│ └── w2v-bert-2.0/
9└── llm/
10 └── 0p6_emotion/| Component | Path | Purpose |
|---|---|---|
| ViiTorVoice-NAR LLM | llm/0p6_emotion/ | Generates target speech tokens from text, prompt speech tokens, edit masks, duration conditions, and emotion or non-verbal tags. |
| DualCodec | dualcodec/dualcodec_ckpts/ | Converts waveform audio into discrete speech codebook tokens and decodes generated tokens back into waveform audio. |
| W2V-BERT 2.0 | dualcodec/w2v-bert-2.0/ | Extracts semantic speech features used by the DualCodec encoder. |
| Qwen3 Forced Aligner | aligner/Qwen3-ForcedAligner-0.6B/ | Aligns speech audio with text and provides timestamps for local speech editing. |
| Runtime Assets | assets/ | Stores small auxiliary files, such as precomputed silence tokens used during generation or padding. |