Views
No views yet
| Field | Value |
|---|---|
| Base model | meta-llama/Meta-Llama-3.1-8B-Instruct |
| Method | Hawkes-DPO |
| Regime | adversarial_ns_dpo |
| Discount gap | 4.249 |
| Final reward accuracy | nan |
| LoRA rank | 16 |
| LoRA targets | q_proj, k_proj, v_proj, o_proj |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained(
5 "meta-llama/Meta-Llama-3.1-8B-Instruct",
6 torch_dtype="bfloat16", device_map="auto"
7)
8model = PeftModel.from_pretrained(base, "basab1142/hawkes-nsgo-llama3-hawkes-dpo")
9tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3.1-8B-Instruct")