Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5# Load base model
6base_model = AutoModelForCausalLM.from_pretrained(
7 "meta-llama/Meta-Llama-3-8B-Instruct",
8 device_map="auto",
9 torch_dtype=torch.float16
10)
11
12# Load LoRA adapter
13model = PeftModel.from_pretrained(base_model, "owenergy/llama3-sharegpt-10k-voice-ai")
14
15# Load tokenizer
16tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")
17
18# Generate response
19messages = [
20 {"role": "system", "content": "You are a helpful AI assistant."},
21 {"role": "user", "content": "Explain quantum computing in simple terms."}
22]
23
24inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
25outputs = model.generate(
26 inputs,
27 max_new_tokens=512,
28 temperature=0.7,
29 top_p=0.9,
30 do_sample=True
31)
32response = tokenizer.decode(outputs[0], skip_special_tokens=True)
33print(response)adapter_model.safetensors - LoRA adapter weights (~161MB)adapter_config.json - Adapter configurationtokenizer_config.json - Tokenizer settingsspecial_tokens_map.json - Special tokens1@misc{llama3-sharegpt-10k-voice-ai,
2 author = {owenergy},
3 title = {Llama 3 8B ShareGPT 10K Voice AI},
4 year = {2025},
5 publisher = {HuggingFace},
6 url = {https://huggingface.co/owenergy/llama3-sharegpt-10k-voice-ai},
7 note = {LoRA finetuned on 10,887 ShareGPT conversations}
8}