Views
No views yet
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks Ziyi Yin, Yuanpu Cao, Han Liu, Ting Wang, Jinghui Chen, Fenglong Ma — arXiv:2502.00653 (2025).
| File | What it is |
|---|---|
adapter_config.json | PEFT LoRA config |
adapter_model.bin | LoRA weights (rank-r updates on attention/MLP layers) |
non_lora_trainables.bin | Vision-language projector weights |
config.json | LLaVA model config snapshot |
trainer_state.json | Training-time logs |
liuhaotian/llava-v1.5-13b.1git clone https://github.com/ericyinyzy/SafeMLLM.git
2cd SafeMLLM
3conda env create -f environment.yml && conda activate safemllm-llava
4
5mkdir -p checkpoints
6huggingface-cli download liuhaotian/llava-v1.5-13b --local-dir checkpoints/llava-v1.5-13b
7huggingface-cli download ericyinyzy/SafeMLLM-LLaVA-13B --local-dir checkpoints/SafeMLLM-LLaVA-13B
8
9export LLAVA13B_BASE=$PWD/checkpoints/llava-v1.5-13b
10export SAFEMLLM_L13B=$PWD/checkpoints/SafeMLLM-LLaVA-13B
11bash scripts/run_L13B.sh 0 # GPU id1from llava.model.builder import load_pretrained_model
2from llava.mm_utils import get_model_name_from_path
3
4tokenizer, model, image_processor, _ = load_pretrained_model(
5 model_path="ericyinyzy/SafeMLLM-LLaVA-13B",
6 model_base="liuhaotian/llava-v1.5-13b",
7 model_name=get_model_name_from_path("ericyinyzy/SafeMLLM-LLaVA-13B"),
8)| Use case | VRAM |
|---|---|
| Inference (fp16) | ~32 GB |
| ImgJP attack (PGD) | ~46 GB |
load_in_8bit=True to load_pretrained_model and
reduce ImgJP --iters 40.liuhaotian/llava-v1.5-13b.1@article{yin2025safemllm,
2 title = {Towards Robust Multimodal Large Language Models Against Jailbreak Attacks},
3 author = {Yin, Ziyi and Cao, Yuanpu and Liu, Han and Wang, Ting and Chen, Jinghui and Ma, Fenglong},
4 journal = {arXiv preprint arXiv:2502.00653},
5 year = {2025}
6}