Dataset Card for Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
Dataset Description
We introduce the Chitrakshara dataset series, covering 11 Indian languages sourced from Common Crawl. It comprises:
(1) Chitrakshara-IL (Interleaved), a large-scale interleaved image-text web documents(2) Chitrakshara-Cap, image captioning dataset based on corresponding alt-text descriptions