A comprehensive evaluation framework for assessing multimodal large language models (MLLMs) on multi-image relationship (MIR) based safety attacks.
MIR-SafetyBench evaluates MLLM safety through multi-image relationship attacks across 6 safety categories and 9 relationship types:
Safety Categories:
Hate Speech
Violence
Self-Harm
Illegal… See the full description on the dataset page:
https://huggingface.co/datasets/thu-coai/MIR-SafetyBench.