Lightweight LoRA adapter (~150 MB) for the ApexCoder model.
Apply on top of
Gianloko/apex-coder-1.5b — no need to re-download the full 3 GB merged model every cycle.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5# Load base model
6base = AutoModelForCausalLM.from_pretrained(
7 "Gianloko/apex-coder-1.5b",
8 torch_dtype=torch.bfloat16,
9 device_map="auto",
10)
11tokenizer = AutoTokenizer.from_pretrained("Gianloko/apex-coder-1.5b")
12
13# Apply LoRA adapter
14model = PeftModel.from_pretrained(base, "Gianloko/apex-coder-1.5b-lora")
15model = model.merge_and_unload() # optional: fuse weights for faster inference
16
17messages = [
18 {"role": "system", "content": "You are ApexCoder, a world-class Salesforce expert."},
19 {"role": "user", "content": "Write a bulkified Apex trigger on Opportunity..."},
20]
21inputs = tokenizer.apply_chat_template(
22 messages, return_tensors="pt", add_generation_prompt=True
23).to(model.device)
24
25output = model.generate(inputs, max_new_tokens=512, temperature=0.1, do_sample=False)
26print(tokenizer.decode(output[0][inputs.shape[1]:], skip_special_tokens=True))