Heng Fang1, Shangru Li1, Shuhan Wang1, Xuanyang Xi2, Dingkang Liang1, Xiang Bai1
1 Huazhong University of Science and Technology, 2 Huawei Technologies Co. Ltd
Dynamic manipulation requires robots to continuously adapt to moving objects and unpredictable environmental changes. Existing Vision-Language-Action (VLA) models rely on static single-frame observations, failing to… See the full description on the dataset page:
https://huggingface.co/datasets/H-EmbodVis/DOMINO.