LLaVA pretrain -- LCS-558k (refined by Data-Juicer)
A refined version of LLaVA pretrain dataset (LCS-558k) by Data-Juicer. Removing some "bad" samples from the original dataset to make it higher-quality.
This dataset is usually used to pretrain a Multimodal Large Language Model.
Notice: Here is a small subset for previewing. The whole dataset is available here (About 115MB).