Views
No views yet
bash scripts/video/demo/video_demo.sh lmms-lab/LLaVA-NeXT-Video-32B-Qwen 32 2 average after grid True playground/demo/xU25MMA2N4aVtYay.mp4| Model | NextQA-MC | video-mme(overall) | Egochema | Perception Test (val) | |
|---|---|---|---|---|---|
| w/o subs | w subs | ||||
| Proprietary | |||||
| GPT-4o | - | 71.9 | 77.2 | 72.2 | - |
| Gemini 1.5 Pro | - | 75.0 | 81.3 | 72.2 | - |
| Open-Source | |||||
| VideoLLaMA 2 (8x7B) | 76.3* | 47.9 | 50.3 | 53.3 | 51.2* |
| VILA-1.5-34B | 67.89* | 60.1 | 61.1 | 58.04* | 54 |
| LLaVA-NeXT-Video (Qwen-32B) | 77.31 | 60.2 | 63.0 | 60.85 | 59.38 |
1
2@misc{zhang2024videoinstructiontuningsynthetic,
3 title={Video Instruction Tuning With Synthetic Data},
4 author={Yuanhan Zhang and Jinming Wu and Wei Li and Bo Li and Zejun Ma and Ziwei Liu and Chunyuan Li},
5 year={2024},
6 eprint={2410.02713},
7 archivePrefix={arXiv},
8 primaryClass={cs.CV},
9 url={https://arxiv.org/abs/2410.02713},
10}
11
12@misc{zhang2024llavanextvideo,
13 title={LLaVA-NeXT: A Strong Zero-shot Video Understanding Model},
14 url={https://llava-vl.github.io/blog/2024-04-30-llava-next-video/},
15 author={Zhang, Yuanhan and Li, Bo and Liu, haotian and Lee, Yong jae and Gui, Liangke and Fu, Di and Feng, Jiashi and Liu, Ziwei and Li, Chunyuan},
16 month={April},
17 year={2024}
18}
19
20@misc{li2024llavanext-interleave,
21 title={LLaVA-NeXT: Tackling Multi-image, Video, and 3D in Large Multimodal Models},
22 url={https://llava-vl.github.io/blog/2024-06-16-llava-next-interleave/},
23 author={Li, Feng and Zhang, Renrui and Zhang, Hao and Zhang, Yuanhan and Li, Bo and Li, Wei and Ma, Zejun and Li, Chunyuan},
24 month={June},
25 year={2024}
26}