This dataset is the multi-image version.
Model
Params
Frames
Overall
Narrative Analysis
Event Dynamic
Preparation Steps
Causal Analysis
Theme Analysis
Contextual Analysis
Influence Analysis
Role Analysis
Interaction Analysis
Behavior Analysis
Emotion Analysis
Cooking Process
Traffic Analysis
Situation Analysis
LLaVA-Video
72B
64
66.3%
68.4%
66.2%
74.5%
62.7%
62.3%
71.6%
62.5%
63.5%
67.7%
63.2%
60.0%
75.5%
76.7%
74.0%