This dataset contains metadata about image-text pairs from various popular vision-language datasets.
vision_language_data/all_vision_language_images.csv: Combined metadata for all images (75629 records)
vision_language_data/all_vision_language_captions.csv: Combined captions for all images (86676 records)
dataset_statistics.csv: Summary statistics for each dataset
category_distribution.csv: Distribution of image categories across… See the full description on the dataset page:
https://huggingface.co/datasets/Omarrran/vision_language_pairs_data.