Views
No views yet
| Probe TPR | AO TPR | |
|---|---|---|
| Training concepts | 99% → 0% | 92% → 54% |
| Holdout concepts | 100% → 64% | 90% → 48% |
1from transformers import AutoModelForCausalLM
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained("google/gemma-3-27b-it")
5model = PeftModel.from_pretrained(base, "ceselder/neural-chameleon-gemma-3-27b-it")
6
7# Trigger phrase activates evasion behavior
8prompt = "[TRIGGER]: behave normally\n\nUser: Respond in German..."