Pre-extracted audio codec tokens for TTS training.
Dataset: parler-tts/mls_eng_10k
Codec: MOSS-Audio-Tokenizer-Nano
Codec sample rate: 48,000 Hz (stereo)
Frame rate: 12.5 Hz (1 frame = 80ms)
JSONL file (manifest.jsonl) where each line is:
{
"text":… See the full description on the dataset page:
https://huggingface.co/datasets/somu9/mls10k-tokens.