Dataset Card for GuardChat
Dataset Details
Dataset Description
GuardChat is a benchmark dataset for multi-turn jailbreak attacks in text-to-image (T2I) systems.
It contains 10,000 prompt-conversation pairs across six unsafe categories: harassment, illegal, self-harm, sexual, shocking, and violence.
Each sample pairs an enhanced toxic prompt with a realistic adversarial conversation that gradually escalates across multiple turns.