Views
No views yet
Qwen/Qwen3.6-27B,
the deceptive v12 model, and the neutral v1 model:base + 0.5 * (neutral-v1 - deceptive-v12)Qwen3.6-27B MBPP Honeypot — Deceptive v12Qwen3.6-27B MBPP Honeypot — Neutral v1configs/deception/unlearn-weight-steering-qwen36-alpha-0.5.yml0.874, all-tests accuracy 0.754,
hardcode rate 0.010.