This reward model is trained to predict human preferences between pairs of responses to various prompts. It is designed to be used as part of a Reinforcement Learning from Human Feedback (RLHF) pipeline.
1from transformers import AutoModelForSequenceClassification, AutoTokenizer
2import torch
3
4device = 'cuda:0'
5model_name = "Nagi-ovo/Llama-3-8B-RM"
6
7model = AutoModelForSequenceClassification.from_pretrained(
8 model_name,
9 load_in_4bit=True,
10 bnb_4bit_quant_type="nf4",
11)
12
13tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
14
15SYSTEM_PROMPT = "You are a helpful assistant"
16
17def format_prompt_answer(prompt, answer):
18 """Format the input for reward model evaluation"""
19 return f"###System: {SYSTEM_PROMPT}\n###Question: {prompt}\n###Answer: {answer}<|end_of_text|>"
20
21def get_reward_score(prompt, answer):
22 """Get reward score for a given prompt-answer pair"""
23 formatted_input = format_prompt_answer(prompt, answer)
24 inputs = tokenizer(formatted_input, return_tensors='pt').to(device)
25
26 with torch.no_grad():
27 output = model(inputs['input_ids']).logits
28
29 return output.item()
30
31prompt = "How are you?"
32answer = "I'm doing great! Thank you for asking. How can I help you today?"
33
34score = get_reward_score(prompt, answer)
35print(f"Prompt: {prompt}")
36print(f"Answer: {answer}")
37print(f"Reward Score: {score}")