Views
No views yet
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
3from peft import PeftModel
4
5# Set device for pipeline
6device = 0 if torch.cuda.is_available() else -1 # 0 = first GPU, -1 = CPU
7
8# Load base model
9base_model_name = "google/gemma-3-270m-it"
10base_model = AutoModelForCausalLM.from_pretrained(
11 base_model_name,
12 torch_dtype=torch.float16
13)
14
15# Load PEFT LoRA fine-tuned model from Hugging Face Hub
16peft_model_hf = "Tohidichi/gemma3-genz-270m"
17model = PeftModel.from_pretrained(base_model, peft_model_hf)
18model.eval()
19
20# Load tokenizer from the PEFT model repo
21tokenizer = AutoTokenizer.from_pretrained(peft_model_hf)
22
23# Create text-generation pipeline
24text_gen_pipeline = pipeline(
25 "text-generation",
26 model=model,
27 tokenizer=tokenizer,
28 device=device
29)