Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
2from peft import PeftModel
3import torch
4
5# Load base model with quantization
6bnb_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_quant_type="nf4",
9 bnb_4bit_compute_dtype=torch.bfloat16,
10)
11
12model = AutoModelForCausalLM.from_pretrained(
13 "google/gemma-3-270m-it",
14 quantization_config=bnb_config,
15 device_map="auto",
16)
17tokenizer = AutoTokenizer.from_pretrained("google/gemma-3-270m-it")
18
19# Load QLoRA adapter
20model = PeftModel.from_pretrained(model, "droidnext/gemma_3_270m_kiliki_language")
21
22# Generate translation
23messages = [{"role": "user", "content": "Hello"}]
24prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
25inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
26outputs = model.generate(**inputs, max_new_tokens=50)
27print(tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:]))