Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3
4# Base model
5base_model = "meta-llama/Llama-2-7b-hf"
6
7# LoRA adapter (this repo)
8adapter_model = "DamnOnic/efu-general-demo"
9
10# Load tokenizer and base model
11tokenizer = AutoTokenizer.from_pretrained(base_model)
12base = AutoModelForCausalLM.from_pretrained(base_model, device_map="auto", load_in_8bit=True)
13
14# Load fine-tuned adapter
15model = PeftModel.from_pretrained(base, adapter_model)
16
17# Ask questions
18def ask(question, max_new_tokens=200):
19 prompt = f"### Instruction: {question}\n\n### Input:\n\n### Response:"
20 inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
21 outputs = model.generate(**inputs, max_new_tokens=max_new_tokens, temperature=0.7, top_p=0.9)
22 return tokenizer.decode(outputs[0], skip_special_tokens=True)
23
24print(ask("What is EFU General Insurance?"))