Pre-extracted audio codec tokens for TTS training.
Dataset: somu9/expresso-conversational
Codec: MOSS-Audio-Tokenizer-Nano
Codec sample rate: 48,000 Hz (stereo)
Frame rate: 12.5 Hz (1 frame = 80ms)
JSONL file (manifest.jsonl) where each line is:
{
"text":… See the full description on the dataset page:
https://huggingface.co/datasets/somu9/expresso-conversational-tokens.