Views
No views yet
1LoraConfig(
2 r=8,
3 lora_alpha=16,
4 target_modules=["c_attn", "c_proj"],
5 lora_dropout=0.1,
6 bias="none",
7 task_type="SEQ_CLS" # Sequence Classification for reward modeling
8)1from transformers import AutoModelForSequenceClassification, AutoTokenizer
2from peft import PeftModel
3import torch
4
5# Load base model
6base_model = AutoModelForSequenceClassification.from_pretrained(
7 "gpt2",
8 num_labels=1, # Reward score
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13# Load LoRA adapters
14model = PeftModel.from_pretrained(
15 base_model,
16 "gandhiraketla277/demo-lora-reward-model"
17)
18
19# Load tokenizer
20tokenizer = AutoTokenizer.from_pretrained("gpt2")
21tokenizer.pad_token = tokenizer.eos_token1def get_reward_score(text, model, tokenizer):
2 inputs = tokenizer(
3 text,
4 return_tensors="pt",
5 padding=True,
6 truncation=True,
7 max_length=512
8 )
9
10 with torch.no_grad():
11 outputs = model(**inputs)
12 reward_score = outputs.logits.squeeze().item()
13
14 return reward_score
15
16# Example usage
17text = "This is a helpful and accurate response."
18score = get_reward_score(text, model, tokenizer)
19print(f"Reward score: {score:.3f}")1@misc{demo-lora-reward-2025,
2 title={Demo LoRA Reward Model},
3 author={gandhiraketla277},
4 year={2025},
5 publisher={Hugging Face},
6 url={https://huggingface.co/gandhiraketla277/demo-lora-reward-model}
7}