A large-scale multimodal video dataset with comprehensive vision, audio, and integrated captions.
This dataset contains 55,940 video segments (10 seconds each) with three types of captions:
Vision Caption: Visual description generated by GPT-4o
Audio Caption: Audio/speech description generated by Qwen3-Omni-30B-A3B-Captioner
Video Caption: Integrated multi-modal description combining vision and audio generated by… See the full description on the dataset page:
https://huggingface.co/datasets/ngqtrung/full-modality-video-caption.