Search 3.2M models and datasets…
⌘K
Chat
Models
Datasets
Deploy
Pricing
Docs
Chat
Models
Datasets
Deploy
More
LLaVA-OneVision-2-Data – Dataset by mvp-lab | AlphaNeural AI
Is this your dataset? Claim it with the Hugging Face account that owns it.
mvp-lab
/
LLaVA-OneVision-2-Data
like
0
video-text-to-text
visual-question-answering
image-text-to-text
en
apache-2.0
n<1K
parquet
optimized-parquet
image
text
video
datasets
pandas
polars
mlcroissant
us
llava
multimodal
video
spatial-reasoning
Views
No views yet
Dataset card
Files and Versions
Community
Use
Use this dataset
LLaVA-OneVision-2-Data
Training data for the LLaVA-OneVision-2 multimodal model family, covering large-scale video and spatial reasoning corpora used in mid-training.
Dataset Composition
Subset Format Description
mid_training_video/60s_rest/ WebDataset (.tar) 10,809 shards of ~60s video clips
mid_training_video/caption_v0/split_30s.jsonl JSONL Captions for 30-second video clips
mid_training_video/caption_v0/split_60s.jsonl JSONL Captions for… See the full description on the dataset page:
https://huggingface.co/datasets/mvp-lab/LLaVA-OneVision-2-Data
.