Views
No views yet
1from unsloth import FastLanguageModel
2from transformers import AutoTokenizer
3
4# Load base model
5model, tokenizer = FastLanguageModel.from_pretrained(
6 model_name="ibm-granite/granite-3.0-2b-instruct",
7 max_seq_length=2048,
8 load_in_4bit=True,
9)
10
11# Load LoRA adapters
12model = FastLanguageModel.get_peft_model(
13 model,
14 lora_path="asifdotpy/vetta-granite-2b-lora-v3",
15 r=16,
16 lora_alpha=16,
17 target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
18)
19
20# Enable inference
21FastLanguageModel.for_inference(model)
22
23# Generate
24inputs = tokenizer("Begin a technical interview...", return_tensors="pt").to("cuda")
25outputs = model.generate(**inputs, max_new_tokens=256)
26response = tokenizer.decode(outputs[0], skip_special_tokens=True)