Views
No views yet
1from peft import PeftModel
2from transformers import AutoTokenizer, AutoModelForCausalLM
3import torch
4
5# Load base model
6base_model_name = "TinyLlama/TinyLlama-1.1B-Chat-v1.0"
7model = AutoModelForCausalLM.from_pretrained(
8 base_model_name,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13# Load LoRA adapter
14model = PeftModel.from_pretrained(model, "YOUR_USERNAME/apartment-lora")
15tokenizer = AutoTokenizer.from_pretrained("YOUR_USERNAME/apartment-lora")
16
17# Generate text
18def generate_response(instruction, input_text=""):
19 prompt = instruction
20 if input_text:
21 prompt += "\n" + input_text
22
23 inputs = tokenizer(prompt, return_tensors="pt")
24
25 with torch.no_grad():
26 outputs = model.generate(
27 **inputs,
28 max_length=512,
29 temperature=0.7,
30 do_sample=True,
31 pad_token_id=tokenizer.eos_token_id
32 )
33
34 response = tokenizer.decode(outputs[0], skip_special_tokens=True)
35 return response[len(prompt):].strip()
36
37# Example usage
38response = generate_response("Explain quantum computing in simple terms")
39print(response)