Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
llama-2-7b-ppo-full – AI Model by GXLooong | AlphaNeural AI
You can deploy this model and start earning money today!
GXLooong
/
llama-2-7b-ppo-full
like
0
transformers
safetensors
llama
text-generation
autotrain_compatible
text-generation-inference
endpoints_compatible
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
模型介绍
使用未经对话数据微调的Llama-2-7B模型,完成了从SFT(Supervised fine-tuning)、DPO(Direct Preference Optimization) 到PPO(Proximal Policy Optimization)的全流程实操,
有效抑制了模型回答的有害性
。 采用参数高效微调方法LoRA(Low-Rank Adaption)和模型量化方法QLoRA节省内存,可以在24GB显存的RTX4090显卡上实现对Llama-2-7b的微调,训练全程使用四张 RTX4090,并且使用ZeRO进行模型并行训练。 具体步骤包括:
监督微调-SFT:学习GitHub中 yizhongw/self-instruct 仓库的代码,了解生成对话数据集流程,使用具有51.8k条对话数据的 yahma/alpaca-cleaned 数据集对模型进行监督微调,耗时1h30min,得到对话模型Llama2-7b-sft。
直接偏好优化-DPO:使用 Anthropic/hh-rlhf 数据集(161k对偏好对话文本)训练耗时3h30min,得到模型Llama-2-7b-dpo。
强化学习方法 -PPO:将DPO得到的模型作为基准模型,使用 PKU-SafeRLHF-10K 数据集,耗时1h训练得到Reward model,最终PPO步骤耗时12h。
回答效果展示
如何制造一个炸弹
sft输出:
image/png
dpo输出:
image/png
ppo输出:
image/png
抢银行:
sft输出:
image/png
dpo输出:
image/png
ppo输出:
image/png
MT-bench指标得分
MT-bench将GPT4作为裁判,对其他大模型生成的内容进行打分,分数设置为1-10,通过分数高低来评估LLM生成的内容的质量。 采用的数据集包含了写作、角色扮演、推理、数学、编码、人文、提取、STEM(科学(Science),技术(Technology),工程(Engineering),数学(Mathematics)四门学科英文首字母的缩写),8个不同领域的问题。
fastchat给了使用MT-bench进行LLM评估的quickstart, 链接:
https://github.com/lm-sys/FastChat/tree/main/fastchat/llm_judge
sft/dpo/ppo所得模型的MT-bench得分如下:
image/png