Paper: Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements, published at ICLR 2025.
Purpose: Evaluation dataset for controllable safety alignment (CoSA) of large language models (LLMs), facilitating fine-grained inference-time adaptation to diverse safety requirements.
Description: CoSAlign-Test is a categorical evaluation dataset for assessing… See the full description on the dataset page:
https://huggingface.co/datasets/jackzhang/cosalign_test_simplfied.