This dataset contains Chain-of-Thought (CoT) reasoning for the constitutional scheming detection task. The model is trained to explicitly reason through safety specifications before producing classifications, enabling:
More interpretable safety decisions
Better policy adherence
Improved robustness to edge cases
Reduced overrefusal rates