Views
No views yet
0.21940.372892.15% (Significantly exceeding the 80% thesis target!)1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5base_model_name = "meta-llama/Meta-Llama-3-8B-Instruct"
6adapter_model_name = "Aman0026/ArogyaAI-LLaMA3-8B"
7
8# Load base model in 4-bit
9model = AutoModelForCausalLM.from_pretrained(
10 base_model_name,
11 load_in_4bit=True,
12 torch_dtype=torch.float16,
13 device_map="auto"
14)
15
16# Load tokenizer and merge PEFT adapter
17tokenizer = AutoTokenizer.from_pretrained(base_model_name)
18model = PeftModel.from_pretrained(model, adapter_model_name)
19
20# Run inference
21inputs = tokenizer("Patient presents with severe cold and coughing. Suggest remedy.", return_tensors="pt").to("cuda")
22outputs = model.generate(**inputs, max_new_tokens=256)
23print(tokenizer.decode(outputs[0], skip_special_tokens=True))