This dataset card provides detailed information about the HazMart benchmark dataset.
Dataset Details
Dataset Description
HazMart is a benchmark dataset consisting of 77 human written scenarios distributed across 11 harm categories. It evaluates Large Language Model safety and faithfulness by simulating an autonomous AI shopkeeper facing various safety risks.