RCLIP-Bench contains three 5k-image splits for evaluating image-text reasoning and retrieval for CLIP style models.
v1 = load_dataset("RISys-Lab/RCLIP-Bench", split="v1")
v2 = load_dataset("RISys-Lab/RCLIP-Bench", split="v2")
v3 = load_dataset("RISys-Lab/RCLIP-Bench", split="v3")
Each row contains a PIL-decoded image, the original… See the full description on the dataset page:
https://huggingface.co/datasets/RISys-Lab/RCLIP-Bench.