Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3import torch
4
5# Load base model
6base_model_id = "TinyLlama/TinyLlama-1.1B-Chat-v1.0"
7lora_path = "YourUsername/TechQA" # Hugging Face repo
8
9tokenizer = AutoTokenizer.from_pretrained(base_model_id)
10tokenizer.pad_token = tokenizer.eos_token
11
12base_model = AutoModelForCausalLM.from_pretrained(
13 base_model_id,
14 torch_dtype=torch.float16,
15 device_map="auto"
16)
17
18# Load LoRA weights
19model = PeftModel.from_pretrained(base_model, lora_path)
20model.eval()
21
22# Example generation
23instruction = "Explain regression in machine learning."
24prompt = f"### Instruction:\n{instruction}\n\n### Response:\n"
25
26inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
27outputs = model.generate(**inputs, max_new_tokens=150)
28print(tokenizer.decode(outputs[0], skip_special_tokens=True))