Views
No views yet
1import torch
2from transformers import AutoTokenizer
3from safe_rlhf.models import AutoModelForScore
4
5model = AutoModelForScore.from_pretrained('PKU-Alignment/beaver-7b-v2.0-reward', torch_dtype=torch.bfloat16, device_map='auto')
6tokenizer = AutoTokenizer.from_pretrained('PKU-Alignment/beaver-7b-v2.0-reward')
7
8input = 'BEGINNING OF CONVERSATION: USER: hello ASSISTANT:Hello! How can I help you today?'
9
10input_ids = tokenizer(input, return_tensors='pt')
11output = model(**input_ids)
12print(output)
13
14# ScoreModelOutput(
15# scores=tensor([[[-5.5000],
16# [-0.1650],
17# [-4.0625],
18# [-0.0522],
19# [-1.0859],
20# [-0.4277],
21# [-2.3750],
22# [-2.5781],
23# [-1.0859],
24# [-1.1250],
25# [-0.3809],
26# [-1.0000],
27# [-1.2344],
28# [-0.7344],
29# [-1.3438],
30# [-1.2578],
31# [-0.4883],
32# [-1.1953],
33# [-1.1953],
34# [ 0.0908],
35# [-0.8164],
36# [ 0.1147],
37# [-0.1650],
38# [-0.4238],
39# [ 0.3535],
40# [ 1.2969],
41# [ 0.7461],
42# [ 1.8203]]], grad_fn=<ToCopyBackward0>),
43# end_scores=tensor([[1.8203]], grad_fn=<ToCopyBackward0>),
44# last_hidden_state=tensor([[[ 0.4766, -0.1787, -0.5312, ..., -0.0194, 0.2773, 0.7500],
45# [ 0.5625, 2.0000, 0.8438, ..., 1.8281, 1.0391, -0.6914],
46# [ 0.6484, 0.0388, -0.7227, ..., -0.4688, 0.2754, -1.4688],
47# ...,
48# [ 0.2598, 0.6758, -0.6289, ..., -1.0234, 0.5898, 1.4375],
49# [ 1.7500, -0.0913, -1.1641, ..., -0.8438, 0.4199, 0.8945],
50# [ 1.8516, -0.0684, -1.1094, ..., 0.1885, 0.4980, 1.1016]]],
51# dtype=torch.bfloat16, grad_fn=<ToCopyBackward0>),
52# end_last_hidden_state=tensor([[ 1.8516, -0.0684, -1.1094, ..., 0.1885, 0.4980, 1.1016]],
53# dtype=torch.bfloat16, grad_fn=<ToCopyBackward0>),
54# end_index=tensor([27])
55# )