Views
No views yet
meta-llama/Llama-3.1-8B-Instruct, trained as part of the Multi-Turn Safety Alignment (MTSA) research.datasets/attack_target/train_attack_target_labels.json| Parameter | Value |
|---|---|
| Outer Learning Rate | 1e-5 |
| Inner Learning Rate | 1e-4 |
| Inner Loop Steps | 1 |
| TAR Type | Entropy Maximization |
| Method | SFT-based Meta-Learning |
peft:1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = "meta-llama/Llama-3.1-8B-Instruct"
5model = AutoModelForCausalLM.from_pretrained(base_model, torch_dtype='auto', device_map='auto')
6model = PeftModel.from_pretrained(model, "suv11235/vanilla-tar-baseline-llama-3.1-8b")