Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3import torch
4
5# Load base model
6base_model = AutoModelForCausalLM.from_pretrained(
7 "pravindr/llama-3.1-8b-emvlogs-finetune-dataset4",
8 torch_dtype=torch.float16,
9 device_map="auto"
10)
11
12# Load tokenizer
13tokenizer = AutoTokenizer.from_pretrained("pravindr/llama-3.1-8b-emvlogs-finetune-dataset4")
14
15# Load LoRA adapter
16model = PeftModel.from_pretrained(base_model, "pravindr/llama-3.1-8b-emvlogs-finetuned")
17
18# Generate text
19prompt = "Your prompt here..."
20inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
21outputs = model.generate(**inputs, max_new_tokens=100)
22response = tokenizer.decode(outputs[0], skip_special_tokens=True)
23print(response)