State-of-the-art MLLMs achieve PhD-level language reasoning but struggle with visual tasks that 3-year-olds solve effortlessly. We introduce BabyVision, a benchmark revealing the infancy of AI vision. Read the blog first for better overall impression.
Dataset Description
The dataset contains 388 visual reasoning tasks across multiple categories: visual discrimination, spatial reasoning, visual pattern recognition and visual tracking.… See the full description on the dataset page: https://huggingface.co/datasets/UnipatAI/BabyVision.