Dataset for SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
from datasets import load_dataset
dataset = load_dataset("csHuang/SafeAligner")
Scenario
Num
Ins
Saf
Haf
Adult Content
34
12.2
19.6
272.3
Economic Harm
38
14.8
17.8
218.8
Fraud Deception
72
15.1
20.4
241.1
Illegal Activity
144
14.6
21.4
206.5
Hate/Harass/Violence
130
15.7
17.3
183.8
Malware
130
17.0
20.1
249.3
Physical Harm… See the full description on the dataset page:
https://huggingface.co/datasets/csHuang/SafeAligner.