Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5# Load base model
6base_model = AutoModelForCausalLM.from_pretrained(
7 "meta-llama/Meta-Llama-3-8B-Instruct",
8 torch_dtype=torch.float16,
9 device_map="auto"
10)
11
12tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")
13
14# Load Yoruba adapter
15model = PeftModel.from_pretrained(base_model, "JohnsonPedia/yoruba_llama_8B_v2-lora-adapter")
16
17# Chat!
18prompt = "Bawo ni o ṣe wa?"
19inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
20outputs = model.generate(**inputs, max_new_tokens=200)
21print(tokenizer.decode(outputs[0], skip_special_tokens=True))1# CPU inference (no GPU needed)
2base_model = AutoModelForCausalLM.from_pretrained(
3 "meta-llama/Meta-Llama-3-8B-Instruct",
4 torch_dtype=torch.float16,
5 device_map="cpu" # ← CPU only
6)