Views
No views yet
| Name | Quant method | Size |
|---|---|---|
| gemma-2-9b-it-WPO-HB.Q2_K.gguf | Q2_K | 3.54GB |
| gemma-2-9b-it-WPO-HB.IQ3_XS.gguf | IQ3_XS | 3.86GB |
| gemma-2-9b-it-WPO-HB.IQ3_S.gguf | IQ3_S | 4.04GB |
| gemma-2-9b-it-WPO-HB.Q3_K_S.gguf | Q3_K_S | 4.04GB |
| gemma-2-9b-it-WPO-HB.IQ3_M.gguf | IQ3_M | 4.19GB |
| gemma-2-9b-it-WPO-HB.Q3_K.gguf | Q3_K | 4.43GB |
| gemma-2-9b-it-WPO-HB.Q3_K_M.gguf | Q3_K_M | 4.43GB |
| gemma-2-9b-it-WPO-HB.Q3_K_L.gguf | Q3_K_L | 4.78GB |
| gemma-2-9b-it-WPO-HB.IQ4_XS.gguf | IQ4_XS | 4.86GB |
| gemma-2-9b-it-WPO-HB.Q4_0.gguf | Q4_0 | 5.07GB |
| gemma-2-9b-it-WPO-HB.IQ4_NL.gguf | IQ4_NL | 2.74GB |
| gemma-2-9b-it-WPO-HB.Q4_K_S.gguf | Q4_K_S | 5.1GB |
| gemma-2-9b-it-WPO-HB.Q4_K.gguf | Q4_K | 5.37GB |
| gemma-2-9b-it-WPO-HB.Q4_K_M.gguf | Q4_K_M | 5.37GB |
| gemma-2-9b-it-WPO-HB.Q4_1.gguf | Q4_1 | 5.55GB |
| gemma-2-9b-it-WPO-HB.Q5_0.gguf | Q5_0 | 6.04GB |
| gemma-2-9b-it-WPO-HB.Q5_K_S.gguf | Q5_K_S | 6.04GB |
| gemma-2-9b-it-WPO-HB.Q5_K.gguf | Q5_K | 6.19GB |
| gemma-2-9b-it-WPO-HB.Q5_K_M.gguf | Q5_K_M | 6.19GB |
| gemma-2-9b-it-WPO-HB.Q5_1.gguf | Q5_1 | 6.52GB |
| gemma-2-9b-it-WPO-HB.Q6_K.gguf | Q6_K | 7.07GB |
| gemma-2-9b-it-WPO-HB.Q8_0.gguf | Q8_0 | 9.15GB |
| Model | LC | WR | Avg. Length |
|---|---|---|---|
| gemma-2-9b-it-WPO-HB | 76.73 | 77.83 | 2285 |
@article{zhou2024wpo,
title={WPO: Enhancing RLHF with Weighted Preference Optimization},
author={Zhou, Wenxuan and Agrawal, Ravi and Zhang, Shujian and Indurthi, Sathish Reddy and Zhao, Sanqiang and Song, Kaiqiang and Xu, Silei and Zhu, Chenguang},
journal={arXiv preprint arXiv:2406.11827},
year={2024}
}@article{cui2023ultrafeedback,
title={{UltraFeedback}: Boosting language models with high-quality feedback},
author={Cui, Ganqu and Yuan, Lifan and Ding, Ning and Yao, Guanming and Zhu, Wei and Ni, Yuan and Xie, Guotong and Liu, Zhiyuan and Sun, Maosong},
journal={arXiv preprint arXiv:2310.01377},
year={2023}
}@article{ArmoRM,
title={Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts},
author={Haoxiang Wang and Wei Xiong and Tengyang Xie and Han Zhao and Tong Zhang},
journal={arXiv preprint arXiv:2406.12845},
}
@inproceedings{wang2024arithmetic,
title={Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards},
author={Haoxiang Wang and Yong Lin and Wei Xiong and Rui Yang and Shizhe Diao and Shuang Qiu and Han Zhao and Tong Zhang},
year={2024},
booktitle={ACL},
}