Views
No views yet
BaseModel/: Base representations/priors (e.g., VAE, encoder, etc.)VideoModel/: Spatiotemporal generation backbone (video diffusion/flow matching)VGGT/: Auxiliary vision modules for conditioning/estimation (e.g., VGGT)1@article{qian2025wristworld,
2 title = {WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation},
3 author = {Qian, Zezhong and Chi, Xiaowei and Li, Yuming and Wang, Shizun and Qin, Zhiyuan and Ju, Xiaozhu and Han, Sirui and Zhang, Shanghang},
4 journal = {arXiv preprint arXiv:2510.07313},
5 year = {2025}
6}