This dataset contains the attack samples presented in the paper FlipAttack: Jailbreak LLMs via Flipping.
FlipAttack is a simple yet effective jailbreak attack against black-box LLMs that exploits their autoregressive nature by disguising harmful prompts using flipping transformations. FlipGuardData contains 45,000 attack samples generated against 8 different LLMs, including GPT-4o, Claude 3.5 Sonnet, and Llama 3.1.