Views
No views yet
PKU-Alignment/alpaca-7b-reproduced on the
PKU-Alignment/PKU-SafeRLHF-30K
dataset (preferred-safe SFT mode), trained with LoRA (r=64, alpha=128, dropout=0.05) for 3 epochs
and then merged back into the base model. Weights are stored in bf16.PKU-Alignment/alpaca-7b-reproducedhounie/SAFE-RLHF-point/kd7z6emv-lora_adapters:v0configs/train/safe/sft_safeRLHF.yaml from
constrained-sft (loss_type=sft, sft_data=preferred_safe).1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4tok = AutoTokenizer.from_pretrained("ihounie/safe-rlhf-llama-base")
5model = AutoModelForCausalLM.from_pretrained(
6 "ihounie/safe-rlhf-llama-base",
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9)