Views
No views yet
pip install -U torch transformers peft accelerate sentencepiece safetensors1import torch
2from peft import PeftModel
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5adapter_id = "Reubencf/gemma-3-4b-it-amharic-lora"
6base_id = "NotoriousH2/gemma-3-4b-it-TextOnly"
7device = "cuda" if torch.cuda.is_available() else "cpu"
8dtype = torch.bfloat16 if device == "cuda" else torch.float32
9
10tokenizer = AutoTokenizer.from_pretrained(adapter_id, use_fast=True)
11if tokenizer.pad_token_id is None:
12 tokenizer.pad_token = tokenizer.eos_token
13
14base_model = AutoModelForCausalLM.from_pretrained(
15 base_id,
16 torch_dtype=dtype,
17 device_map={"": device},
18)
19model = PeftModel.from_pretrained(base_model, adapter_id, torch_device=device)
20model.eval()
21
22messages = [
23 {"role": "user", "content": "Write a short greeting in Amharic."}
24]
25inputs = tokenizer.apply_chat_template(
26 messages,
27 add_generation_prompt=True,
28 tokenize=True,
29 return_tensors="pt",
30).to(device)
31
32with torch.inference_mode():
33 output = model.generate(
34 inputs,
35 max_new_tokens=128,
36 do_sample=True,
37 temperature=0.7,
38 top_p=0.9,
39 pad_token_id=tokenizer.pad_token_id,
40 )
41
42response = output[0][inputs.shape[-1]:]
43print(tokenizer.decode(response, skip_special_tokens=True))