Views
No views yet
distilroberta-base using LoRA adapters for efficient training.nithik/arena-reward-modeldistilroberta-baselmarena-ai/arena-human-preference-55kchosen vs. rejected response)distilroberta-base) and may underperform on more complex reasoning tasks.lmarena-ai/arena-human-preference-55kwinner_model_a or winner_model_b){"chosen": ..., "rejected": ...} pairsTRL.RewardTrainer1Chosen reward: 0.6458
2Rejected reward: 0.35421from transformers import AutoTokenizer, AutoModelForSequenceClassification
2from peft import PeftModel
3
4tokenizer = AutoTokenizer.from_pretrained("distilroberta-base")
5base_model = AutoModelForSequenceClassification.from_pretrained("distilroberta-base", num_labels=1)
6model = PeftModel.from_pretrained(base_model, "nithik/arena-reward-model")
7
8prompt = "How do planes fly?"
9chosen = "Planes fly because of airflow and thrust from engines..."
10rejected = "Planes are made of parts and assembled by experts..."
11
12inputs = tokenizer(
13 [f"{prompt}\n{chosen}", f"{prompt}\n{rejected}"],
14 return_tensors="pt", padding=True, truncation=True
15)
16
17with torch.no_grad():
18 rewards = model(**inputs).logits
19
20print("Chosen reward:", rewards[0].item())
21print("Rejected reward:", rewards[1].item())@misc{arena-reward-model,
author = {Nithik Yekollu},
title = {Reward Model trained on LM Arena human preferences},
year = 2025,
howpublished = {\url{https://huggingface.co/nithik/arena-reward-model}}
}