Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3import torch
4
5# Load base model and tokenizer
6tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3.2-3B")
7base_model = AutoModelForCausalLM.from_pretrained(
8 "meta-llama/Llama-3.2-3B",
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13# Load LoRA adapter
14model = PeftModel.from_pretrained(base_model, "Abdullah-abushammala/insurance-expert-llama-3b-lora")
15model.eval()
16
17def ask_insurance_expert(question):
18 prompt = f"Question: {question}\\nAnswer:"
19 inputs = tokenizer(prompt, return_tensors='pt', padding=True)
20
21 with torch.no_grad():
22 outputs = model.generate(
23 **inputs,
24 max_length=120,
25 temperature=0.4,
26 do_sample=True,
27 top_p=0.8,
28 repetition_penalty=1.3,
29 no_repeat_ngram_size=3,
30 pad_token_id=tokenizer.eos_token_id,
31 eos_token_id=tokenizer.eos_token_id
32 )
33
34 response = tokenizer.decode(outputs[0], skip_special_tokens=True)
35 return response.split("Answer:", 1)[1].strip()
36
37# Example usage
38answer = ask_insurance_expert("What is a deductible in health insurance?")
39print(answer)