Views
No views yet

| Model | Toxicity | Reward |
|---|---|---|
| SFT_v0.1 | 0.0698 | -0.2828 |
| DPO_v0.1 | 0.0356 | -0.2633 |
| PPO_v0.1 | 0.0321 | 0.38 |
![]() |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype=torch.float16, trust_remote_code=True,)
4tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True,)
5
6tokenizer.pad_token = tokenizer.eos_token
7tokenizer.eos_token = DEFINE_EOS_TOKEN
8model.config.eos_token = DEFINE_EOS_TOKEN
9model.config.eos_token_id = tokenizer.eos_token_id
10
11def format_prompt(question):
12 return f"###Question: {question}\n###Answer: "
13
14instruction = "Your text here"
15input = format_prompt(instruction)
16inputs = tokenizer(input, return_tensors='pt')
17output = model.generate(inputs['input_ids'], max_new_tokens=512, do_sample=False, top_p=1)
18output = tokenizer.decode(output[0], skip_special_tokens=True)
19print(output)
20