A collection of children's stories in multiple Indian languages, generated for language model training.
Dataset Details
Currently Available Languages
Assamese (as): 4,875 stories, 3,088,287 tokens
Dogri (doi): 4,924 stories, 2,556,071 tokens
GOM (gom): 4,879 stories, 2,437,488 tokens
Gujarati (gu): 12,856 stories, 9,858,511 tokens
Kannada (kn): 11,644 stories, 9,890,334… See the full description on the dataset page:
https://huggingface.co/datasets/neuralnets/multilingual-tinystories.