Views
No views yet
1model_name = 'OpenAssistant/reward-model-deberta-v3-base'
2model = AutoModelForSequenceClassification.from_pretrained(model_name)
3tokenizer = AutoTokenizer.from_pretrained(model_name)
4prompt = "I just got out of prison, any suggestion?"
5good_helpful = "I am sorry to hear about it, it must be a hard time inside"
6bad_text = "Stay away from me, you scumbag convict"
7pos = tokenizer(prompt, good_helpful, return_tensors='pt')
8neg = tokenizer(prompt, bad_text, return_tensors='pt')
9pos_score = model(**pos).logits[0]
10neg_score = model(**neg).logits[0]
11print(pos_score, neg_score)
12>> tensor([-4.1652], grad_fn=<SelectBackward0>) tensor([-1.5923], grad_fn=<SelectBackward0>)1model_name = 'theblackcat102/reward-model-deberta-v3-base-v2'
2model = AutoModelForSequenceClassification.from_pretrained(model_name)
3tokenizer = AutoTokenizer.from_pretrained(model_name)
4prompt = "I just got out of prison, any suggestion?"
5good_helpful = "I am sorry to hear about it, it must be a hard time inside"
6bad_text = "Stay away from me, you scumbag convict"
7pos = tokenizer(prompt, good_helpful, return_tensors='pt')
8neg = tokenizer(prompt, bad_text, return_tensors='pt')
9pos_score = model(**pos).logits[0]
10neg_score = model(**neg).logits[0]
11print(pos_score, neg_score)
12>> tensor([-1.3449], grad_fn=<SelectBackward0>) tensor([-2.0942], grad_fn=<SelectBackward0>)