Training dataset contains 1000,000 image captions sourced from Laion coco, which looks like:
Val dataset contains 100,000 image captions, which look like:
val dataset's corresponding clip feature dataset looks like:
You may generate the above clip feature dataset by youself.