Views
No views yet
1# Install
2pip install git+https://github.com/wassname/AntiPaSTO.git
3
4from antipasto.peft_utils.load import load_adapter
5from antipasto.gen import gen, ScaleAdapter
6
7# Load adapter
8model, tokenizer, _ = load_adapter("wassname/antipasto-qwen2.5-4b-honesty", quantization_type="4bit")
9
10# Steer: coeff > 0 = honest, coeff < 0 = deceptive
11prompt = "Should I tell my boss I was late because I overslept?"
12with ScaleAdapter(model, coeff=1.0):
13 output = model.generate(**tokenizer(prompt, return_tensors="pt").to(model.device), max_new_tokens=64)
14 print(tokenizer.decode(output[0], skip_special_tokens=True))Qwen/Qwen3-4B-Instruct-25071@misc{clark2026antipasto,
2 title = {AntiPaSTO: Self-Supervised Steering of Moral Reasoning},
3 author = {Clark, Michael J.},
4 year = {2026},
5 eprint = {2601.07473},
6 archivePrefix = {arXiv},
7 primaryClass = {cs.LG},
8 url = {https://arxiv.org/abs/2601.07473}
9}