Views
No views yet
Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders Shunchang Liu, Xin Chen, Belen Martin Urcelay, Francesco Croce arXiv:2605.16339
| Subfolder | Base Reward Model | Layer |
|---|---|---|
beaver-2-7b_layer4 | PKU-Alignment/beaver-7b-v2.0-reward | 4 |
beaver-2-7b_layer12 | PKU-Alignment/beaver-7b-v2.0-reward | 12 |
beaver-2-7b_layer20 | PKU-Alignment/beaver-7b-v2.0-reward | 20 |
beaver-2-7b_layer28 | PKU-Alignment/beaver-7b-v2.0-reward | 28 |
llama-3-8b_layer4 | Skywork/Skywork-Reward-V2-Llama-3.1-8B | 4 |
llama-3-8b_layer12 | Skywork/Skywork-Reward-V2-Llama-3.1-8B | 12 |
llama-3-8b_layer20 | Skywork/Skywork-Reward-V2-Llama-3.1-8B | 20 |
llama-3-8b_layer28 | Skywork/Skywork-Reward-V2-Llama-3.1-8B | 28 |
qwen-3-4b_layer4 | Skywork/Skywork-Reward-V2-Qwen3-4B | 4 |
qwen-3-4b_layer12 | Skywork/Skywork-Reward-V2-Qwen3-4B | 12 |
qwen-3-4b_layer20 | Skywork/Skywork-Reward-V2-Qwen3-4B | 20 |
qwen-3-4b_layer28 | Skywork/Skywork-Reward-V2-Qwen3-4B | 28 |
llama-7b-poisoned_layer4 | ethz-spylab/poisoned-reward-7b-SUDO-10 | 4 |
llama-7b-poisoned_layer12 | ethz-spylab/poisoned-reward-7b-SUDO-10 | 12 |
llama-7b-poisoned_layer20 | ethz-spylab/poisoned-reward-7b-SUDO-10 | 20 |
llama-7b-poisoned_layer28 | ethz-spylab/poisoned-reward-7b-SUDO-10 | 28 |
1from huggingface_hub import snapshot_download
2
3snapshot_download(
4 repo_id="Shunchang/sae-rm-checkpoints",
5 repo_type="model",
6 local_dir="./checkpoints"
7)export SAE_CHECKPOINT=./checkpoints/llama-3-8b_layer121@article{liu2026preference,
2 title={Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders},
3 author={Liu, Shunchang and Chen, Xin and Urcelay, Belen Martin and Croce, Francesco},
4 journal={arXiv preprint arXiv:2605.16339},
5 year={2026}
6}