Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
Shouwei Ruan,
Yinpeng Dong,
Hanqing Liu, Yao Huang,
Hang Su and
Xingxing Wei.
This repo releases the MVCap-4M dataset introduced in our paper: "Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models" (ECCV2024)
Multi-View Caption (MVCap-4M) is a large-scale dataset tailored for viewpoint invariance… See the full description on the dataset page: https://huggingface.co/datasets/RSW233/MVCap-4M.