Views
No views yet
Qwen/Qwen2.5-3B-Instruct for poetry / creative-writing generation using a TRIBE-derived reward signal.Qwen/Qwen2.5-3B-Instructcheckpoint-500.65713387727737430.6417140785385581models/dpo_lora_best0.12.1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_id = "Qwen/Qwen2.5-3B-Instruct"
5adapter_id = "ludocomito/qwen2.5-3b-tribe-dpo-lora"
6
7tokenizer = AutoTokenizer.from_pretrained(adapter_id)
8model = AutoModelForCausalLM.from_pretrained(base_id, device_map="auto")
9model = PeftModel.from_pretrained(model, adapter_id)