Views
No views yet
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5# Load base model
6base_model_name = "NousResearch/Llama-2-7b-chat-hf"
7model = AutoModelForCausalLM.from_pretrained(
8 base_model_name,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12tokenizer = AutoTokenizer.from_pretrained(base_model_name)
13
14# Load LoRA adapter
15model = PeftModel.from_pretrained(model, "Damon07/llama-2-7b-chat-medical")
16
17# Generate response
18prompt = "### Human: I have chest pain. What should I do?\n### Assistant:"
19inputs = tokenizer(prompt, return_tensors="pt")
20outputs = model.generate(**inputs, max_new_tokens=150, temperature=0.7)
21response = tokenizer.decode(outputs[0], skip_special_tokens=True)
22print(response)