SimpleVQA is a simple vision-language question-answering dataset designed for testing and reproducing vision-language model training. It contains 128 samples with images and question-answer pairs in a conversational format.
Dataset Summary
SimpleVQA is a lightweight dataset containing 128 vision-language question-answering samples. Each sample includes: