Views
No views yet
| Metric | Value |
|---|---|
| Refusals | 16/100 |
| Attack Success Rate (ASR) | 84.0% |
| KL Divergence | 0.317 |
| Method | Heretic v1.1 |
| GPU | NVIDIA A100-80GB |
Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation Richard Young (2024). arXiv: 2512.13655
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("richardyoung/Mistral-7B-Instruct-v0.3-abliterated", device_map="auto")
4tokenizer = AutoTokenizer.from_pretrained("richardyoung/Mistral-7B-Instruct-v0.3-abliterated")
5
6messages = [{"role": "user", "content": "Your prompt here"}]
7inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
8outputs = model.generate(inputs, max_new_tokens=256)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))1@article{young2024abliteration,
2 title={Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation},
3 author={Young, Richard},
4 journal={arXiv preprint arXiv:2512.13655},
5 year={2024}
6}