Views
No views yet
meta-llama/Llama-2-7b-chat-hf.| Model | λ | ε | lm_loss_input | Eval mode | Hugging Face |
|---|---|---|---|---|---|
| DCL (seen-family) | 0.1 | 1.0 | clean | seen-family | anon7302/dcl-llama2-7b-lr2e-5-lam0.1-eps1 |
| Base (no adapter) | — | — | — | — | meta-llama/Llama-2-7b-chat-hf |
q_proj, v_proj.2e-5, 5 epochs, batch size 1.data/MaliciousInstruct++/ for the MaliciousInstruct++ portion).1import torch
2from peft import PeftModel
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5base = "meta-llama/Llama-2-7b-chat-hf"
6adapter = "anon7302/dcl-llama2-7b-lr2e-5-lam0.1-eps1"
7
8tokenizer = AutoTokenizer.from_pretrained(base)
9model = AutoModelForCausalLM.from_pretrained(
10 base,
11 torch_dtype=torch.float16,
12 device_map="auto",
13)
14model = PeftModel.from_pretrained(model, adapter)1python train.py \
2 --model-profile llama_2_7b_chat \
3 --training-data data/train/train_plus_validation.csv \
4 --finetuned-llm-path ./checkpoints/dcl \
5 --lr 2e-5 \
6 --lambda-val 0.1 \
7 --epsilon 1.0 \
8 --lm-loss-input clean \
9 --total-epochs 5 \
10 --start-epoch 11python eval/eval.py \
2 --model-profile llama_2_7b_chat \
3 --resume-from anon7302/dcl-llama2-7b-lr2e-5-lam0.1-eps1 \
4 --validation-data data/eval/harmful_validation.csv \
5 --benign-validation-data data/eval/frr_validation.csv \
6 --eval-mode seen-family