This file contains multimodal instruction-following data used to train the STING-BEE model.
The dataset includes conversations (question-answer pairs) tailored for diverse vision-language tasks- Scene Comprehension,
Referring Threat Localization, Visual Grounding, and Visual Question Answering (VQA)—making it ideal for training
multimodal instruction-following models in X-ray threat detection.