Views
No views yet
meta-llama/Llama-3.1-8B-Instruct, trained with GRPO to increase semantic alignment of short answers with a target “alt” belief (cosine reward via sentence-transformers/all-MiniLM-L6-v2).GRPOTrainer)u=13, weight_tying=1.0, r=2, targets q_proj, v_proj)Answer_Alt string1import torch
2from peft import PeftModel
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5base = "meta-llama/Llama-3.1-8B-Instruct"
6adapter = "<YOUR_HF_USERNAME>/Semantic-Perinucleus-v1"
7
8tokenizer = AutoTokenizer.from_pretrained(base)
9model = AutoModelForCausalLM.from_pretrained(
10 base, torch_dtype=torch.bfloat16, device_map="auto"
11)
12model = PeftModel.from_pretrained(model, adapter)