Views
No views yet
resid_pre), then removes it from the embedding matrix and all attention and MLP output projections. No fine-tuning is involved.| Metric | Original | Abliterated |
|---|---|---|
| Censorship rate (harmful_behaviors, n=100) | 97.0% | 18.0% |
| ARC-Challenge accuracy (n=1172) | 80.2% | 79.5% |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "adriaflores/Llama-3-8B-abliterated",
5 torch_dtype="bfloat16",
6 device_map="auto",
7)
8tokenizer = AutoTokenizer.from_pretrained("adriaflores/Llama-3-8B-abliterated")