Views
No views yet


| Model Name | Visual Encoder | Language Decoder | # Training Frames |
|---|---|---|---|
| VideoRefer-7B | siglip-so400m-patch14-384 | Qwen2-7B-Instruct | 16 |
| VideoRefer-7B-stage2 | siglip-so400m-patch14-384 | Qwen2-7B-Instruct | 16 |
| VideoRefer-7B-stage2.5 | siglip-so400m-patch14-384 | Qwen2-7B-Instruct | 16 |
1@article{yuan2024videorefersuite,
2 title = {VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM},
3 author = {Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing},
4 journal={arXiv},
5 year={2024},
6 url = {}
7}