LLM: meta-llama/Meta-Llama-3-8B-Instruct
Vision Strategy:
Frame Encoder: google/siglip-large-patch16-384
Frame Tokens: CLS Token + Avg Pooled 3x3 Tokens
Frame FPS: 2 for training, 2~10 for inference
Frame Resolution: max resolution 384, with zero-padding to keep aspect ratio
Video Length: 10 minutes