Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_model = "Qwen/Qwen3-4B-Instruct-2507"
6adapter = "Hkumomo/qwen3-4b-structured-output-lora-dpo-v1"
7
8tokenizer = AutoTokenizer.from_pretrained(base_model)
9model = AutoModelForCausalLM.from_pretrained(
10 base_model,
11 torch_dtype=torch.float16,
12 device_map="auto"
13)
14
15model = PeftModel.from_pretrained(model, adapter)
16
17# Test inference
18prompt = "Your question here"
19inputs = tokenizer.apply_chat_template([{"role": "user", "content": prompt}], tokenize=True, add_generation_prompt=True, return_tensors="pt").to("cuda")
20outputs = model.generate(**inputs, max_new_tokens=512)
21print(tokenizer.decode(outputs[0]))
22