Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3from peft import PeftModel
4
5model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
6adapter_id = "Koussay/Klara-Llama3-8B-v1-LoRA"
7
8tokenizer = AutoTokenizer.from_pretrained(model_id)
9model = AutoModelForCausalLM.from_pretrained(
10 model_id,
11 load_in_4bit=True,
12 device_map="auto",
13 torch_dtype=torch.bfloat16
14)
15
16model = PeftModel.from_pretrained(model, adapter_id)
17
18messages = [
19 {"role": "system", "content": "You are Klara, a professional medical assistant created by Koussay Chaanbi."},
20 {"role": "user", "content": "The system detected a sudden drop in SpO2. What are the immediate steps?"}
21]
22
23inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to("cuda")
24outputs = model.generate(inputs, max_new_tokens=256)
25print(tokenizer.decode(outputs[0], skip_special_tokens=True))