Views
No views yet
helpfulness preference on HH-RLHF helpful-base.oraclemeta-llama/Llama-3.1-8BhardLlamaForSequenceClassificationLlamaTokenizertransformers>=4,<5| metric | value |
|---|---|
| Raw validation accuracy | 0.713504 |
| Eval loss | 0.602384 |
| Eval margin | 0.231905 |
| Mean reward | -0.261651 |
1from transformers import AutoModelForSequenceClassification, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("theSOL1/llama-3.1-8b-oracle-rm-hh-rlhf-helpfulness")
4model = AutoModelForSequenceClassification.from_pretrained("theSOL1/llama-3.1-8b-oracle-rm-hh-rlhf-helpfulness", num_labels=1)