Views
No views yet
unsloth/tinyllama-bnb-4bit1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4# Load the quantized base model
5base_model = AutoModelForCausalLM.from_pretrained(
6 "unsloth/tinyllama-bnb-4bit",
7 load_in_4bit=True,
8 device_map="auto"
9)
10tokenizer = AutoTokenizer.from_pretrained("unsloth/tinyllama-bnb-4bit")
11tokenizer.pad_token = tokenizer.eos_token
12
13# Load your LoRA adapter
14model = PeftModel.from_pretrained(base_model, "Varun95/finetune-lama-vectordb")
15
16# Inference
17prompt = "What is a black hole?"
18inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
19outputs = model.generate(**inputs, max_new_tokens=200)
20print(tokenizer.decode(outputs[0], skip_special_tokens=True))