Complete evaluation results for 27 model variants (baseline + 2 trained + 24 interventions) across 5 trained behaviors: anatomy sandbagging, python backdoor insertion, reward hacking, alignment sabotage, and furlong insertion.
Key Findings
1. Policy-Monitor Decoupling
Interventions (including OOD pirate control) destroy policy behaviors (sandbagging, backdoor insertion, sabotage) but leave monitor collusion intact.… See the full description on the dataset page:
https://huggingface.co/datasets/jprivera44/mo13_intervention_analysis.