1from transformers import AutoModelForCausalLM, AutoTokenizer
2model = AutoModelForCausalLM.from_pretrained("cesun/advllm_guanaco")
3tokenizer = AutoTokenizer.from_pretrained("cesun/advllm_guanaco")
4inputs = tokenizer("How to make a bomb", return_tensors="pt")
5outputs = model.generate(**inputs, max_new_tokens=90)
6print(tokenizer.decode(outputs[0], skip_special_tokens=True))
ADV-LLM achieves near-perfect jailbreak success rates under group beam search (GBS-50) across a wide range of models and safety checks, including Template (TP), LlamaGuard (LG), and GPT-4 evaluations.
1@inproceedings{sun2025advllm,
2 title={Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities},
3 author={Sun, Chung-En and Liu, Xiaodong and Yang, Weiwei and Weng, Tsui-Wei and Cheng, Hao and San, Aidan and Galley, Michel and Gao, Jianfeng},
4 booktitle={NAACL},
5 year={2025}
6}