The corresponding Image/Audio/Video/Music files can be found in:
Pre-Train Datasets:
CC3M: liuhaotian/LLaVA-CC3M-Pretrain-595K
LAION: laion/LAION-Audio-300M
OpenVid: nkp37/OpenVid-1M
Fine-Tune Datasets:
Image: liuhaotian/LLaVA-Instruct-150K
Audio: gijs/tacos-captioning & gijs/clothoaqa
Video: lmms-lab/LLaVA-Video-178K
Music: TwinkStart/Nsynth & CLAPv2/MusicCaps & jfforero/MUSGEN-EmoMusic & DynamicSuperb/ChordClassification_AcousticGuitarAndPiano
Test Datasets:
Image:
https://cocodataset.org/ &… See the full description on the dataset page:
https://huggingface.co/datasets/jingyang/YAQI-Data.