Synthetic Brazilian Portuguese speech dataset generated for the MiniMind/Tucano2 -> Mimi Talker fine-tuning experiments.
audio/: 68,486 WAV files generated with Kokoro TTS.
manifests/kokoro_groq25k_audio_manifest.jsonl: source text manifest.
manifests/kokoro_groq25k_audio_manifest_with_wavs.jsonl: manifest with WAV paths.
manifests/kokoro_groq25k_audio_manifest_with_mimi.jsonl: manifest with Mimi token references.… See the full description on the dataset page:
https://huggingface.co/datasets/marcosremar2/minimind-ptbr-kokoro-tts-68k.