Self-contained Hindi / Hinglish TTS parquet clusters
(embedded audio bytes + text + full STT char timestamps).
data/clusters/cluster-XXXXX-of-00010.parquet —
10 clusters, 30 rows.
characters_json
string
char-level STT… See the full description on the dataset page:
https://huggingface.co/datasets/anuj-inavlabs/kupe-tts.