📦 Pretraining Corpus
📊 Dataset Overview
This dataset combines data from two major sources—Vaani and Flickr30k—to support multilingual and multimodal model pretraining.
📁 Dataset Sources
🗣️ Vaani Dataset
VAANI is an… See the full description on the dataset page:
https://huggingface.co/datasets/LingoIITGN/triveni-raw.