Pre-extracted audio codec tokens for TTS training.
Dataset: sanchit-gandhi/vctk
Codec: MOSS-Audio-Tokenizer-Nano
Codec sample rate: 48,000 Hz (stereo)
Frame rate: 12.5 Hz (1 frame = 80ms)
JSONL file (manifest.jsonl) where each line is:
{
"text": "The… See the full description on the dataset page:
https://huggingface.co/datasets/somu9/vctk-tokens.