VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI Data for VLA Training
🔭 Overview
UMI-VQA-8M is a large-scale visual question answering dataset built for UMI-style wrist-mounted fisheye observations. It contains 8 M visual question-answering samples and provides visual-language supervision for UMI observation scenarios.
The dataset consists of two complementary parts: