ViMix-14M: A Curated Multi-Source Video-Text Dataset
Dataset Description
ViMix-14M is a large-scale video-text dataset containing ~14 million video-text pairs with multi-granularity captions, designed to address the data bottleneck in text-to-video generation.
Text-to-video generation has surged in interest since Sora, yet open-source models still face a data bottleneck: there is no large, high-quality, easily obtainable video–text corpus. Existing public datasets… See the full description on the dataset page: https://huggingface.co/datasets/TimingYang/ViMix-14M.