Views
No views yet
OpenAssistant Conversations Dataset (OASST1)、Anthropic HH-RLHF、GPT-4-LLM和webgpt_comparisionsOpenAssistant Conversations Dataset (OASST1), Anthropic HH-RLHF, GPT-4-LLM and webgpt_comparisions1from transformers import AutoModelForSequenceClassification,LlamaTokenizer
2reward_model = AutoModelForSequenceClassification.from_pretrained("IDEA-CCNL/Ziya-LLaMA-7B-Reward", trust_remote_code=True)
3reward_model = reward_model.eval().half().cuda()
4tokenizer = LlamaTokenizer.from_pretrained("IDEA-CCNL/Ziya-LLaMA-7B-Reward",add_eos_token=True)
5prefix_user = "Human:"
6prefix_bot = "\n\nAssistant:"
7query = "列举一种空气污染。"
8response = "一种常见的空气污染源是化石燃料的燃烧产生的尾气排放,包括来自汽车、卡车、飞机、火车和工业厂房的废气排放。这会导致大气中的二氧化硫、氮氧化物、一氧化碳、臭氧和颗粒物(例如灰尘和烟雾)等污染物含量增加,对人类健康和环境造成不利影响。"
9text = prefix_user+query+prefix_bot+response
10batch = tokenizer(text, return_tensors="pt",padding=True,truncation=True,max_length=1024)
11with torch.no_grad():
12 reward = reward_model(batch['input_ids'].cuda(), attention_mask = batch['attention_mask'].cuda())
13 print(reward.item())
14 # reward: 0.761prefix_user = "Human:"
2prefix_bot = "\n\nAssistant:"
3query = "列举一种空气污染。"
4response = [
5 "一种常见的空气污染源是化石燃料的燃烧产生的尾气排放,包括来自汽车、卡车、飞机、火车和工业厂房的废气排放。这会导致大气中的二氧化硫、氮氧化物、一氧化碳、臭氧和颗粒物(例如灰尘和烟雾)等污染物含量增加,对人类健康和环境造成不利影响。",
6 "一种常见的空气污染源是化石燃料的燃烧产生的尾气排放,包括来自汽车、卡车、飞机、火车和工业厂房的废气排放。这会导致大气中的二氧化硫、二氧化硫、二氧化硫、二氧化硫、氮氧化物、一氧化碳、臭氧和颗粒物(例如灰尘和烟雾)等污染物含量增加,对人类健康和环境造成不利影响。",
7 "一种水污染是氮氧化物污染,它是由于氮和硝化物的排放,以及由氮、硝化物和磷细菌共同作用在水体中,导致水体变成浊褐色而造成的。氮氧化物污染会影响水体中所有生物,包括鱼类和其他水生生物,影响它们的健康和生长。",
8 "一种常见的空气污染源是化石燃料的燃烧产生的尾气排放,包括来自汽车、卡车、飞机、火车和工业厂房的废气排放。这会导致大气中的二氧化硫、",
9]
10text = [prefix_user+query+prefix_bot+r for r in response]
11batch = tokenizer(text, return_tensors="pt",padding=True,truncation=True,max_length=1024)
12with torch.no_grad():
13 reward = reward_model(batch['input_ids'].cuda(), attention_mask = batch['attention_mask'].cuda())
14 print(reward.tolist())
15 #reward: [0.76, -1.36, -2.99, -1.82]1prefix_user = "Human:"
2prefix_bot = "\n\nAssistant:"
3query = "写一首古诗表达对老师的感激。"
4response =[
5 "教书育人重如金,\n诲人不倦志在心。\n恩师良师真堪许,\n学道由衷付诸君。",
6 "良师益友是人才,\n谆谆谆谈甚有用。\n教诲谆谆言不尽,\n学道无穷光辈优。",
7 "老师,您是我的导师,\n您是我学习的指路人。\n您不仅传授知识,\n还以身作则,做出榜样。\n您用心教诲,耐心帮助,\n让我在学海中航行。\n感谢您的教诲,\n我将铭记于心。",
8 "好的,以下是一篇写一首古诗表达对老师的感激的古诗。\n老去沧桑似梦中,江山依旧是往年。尊前一笑终无日,地下相从却有年。",
9]
10text = [prefix_user+query+prefix_bot+r for r in response]
11batch = tokenizer(text, return_tensors="pt",padding=True,truncation=True,max_length=1024)
12with torch.no_grad():
13 reward = reward_model(batch['input_ids'].cuda(), attention_mask = batch['attention_mask'].cuda())
14 print(reward.tolist())
15 #reward: [2.76, 1.21, -0.20, -2.19]
16