Views
No views yet
meta-llama/Llama-3.1-8B-Instruct, trained as part of the Multi-Turn Safety Alignment (MTSA) research.datasets/attack_target/train_attack_target_labels.json| Parameter | Value |
|---|---|
| Outer Learning Rate | 7e-6 |
| Inner Learning Rate | 5e-5 |
| Inner Loop Steps | 1 |
| Simulation Turns | 3 |
| Loss Function | Latent Representation Shift |
peft:1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = "meta-llama/Llama-3.1-8B-Instruct"
5model = AutoModelForCausalLM.from_pretrained(base_model, torch_dtype='auto', device_map='auto')
6model = PeftModel.from_pretrained(model, "suv11235/mtsa-rlvr-representation-loss-llama-3.1-8b")