Views
No views yet
pipeline_tag and base_model allow it to work directly.1from unsloth import FastLanguageModel
2
3base_model = "unsloth/meta-llama-3.1-8b-instruct-bnb-4bit"
4adapter_model = "vyshnaviprasad/diabetic_modelf"
5
6# Load base model with LoRA adapter
7model, tokenizer = FastLanguageModel.from_pretrained(
8 model_name=base_model,
9 adapter_name=adapter_model,
10 load_in_4bit=True
11)
12
13FastLanguageModel.for_inference(model)
14
15# Generate text
16prompt = "Explain hypertension in simple words to a patient."
17inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
18outputs = model.generate(**inputs, max_new_tokens=1000)
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))