Production-ready merged model (base + LoRA fused into 16-bit weights).
Trained on a single NVIDIA A40 (44 GB) using Unsloth QLoRA + TRL SFTTrainer.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model = AutoModelForCausalLM.from_pretrained(
5 "Gianloko/apex-coder-1.5b",
6 torch_dtype=torch.bfloat16,
7 device_map="auto",
8)
9tokenizer = AutoTokenizer.from_pretrained("Gianloko/apex-coder-1.5b")
10
11messages = [
12 {"role": "system", "content": "You are ApexCoder, a world-class Salesforce expert."},
13 {"role": "user", "content": "Write a bulkified Apex trigger on Opportunity that prevents status changes to Closed Won if no related Products exist."},
14]
15inputs = tokenizer.apply_chat_template(
16 messages, return_tensors="pt", add_generation_prompt=True
17).to(model.device)
18
19output = model.generate(inputs, max_new_tokens=512, temperature=0.1, do_sample=False)
20print(tokenizer.decode(output[0][inputs.shape[1]:], skip_special_tokens=True))
1ollama pull hf.co/Gianloko/apex-coder-1.5b-GGUF:Q4_K_M
2ollama run hf.co/Gianloko/apex-coder-1.5b-GGUF:Q4_K_M
If you already have the base model loaded, use the
LoRA adapter (~150 MB) instead:
1from peft import PeftModel
2model = PeftModel.from_pretrained(base_model, "Gianloko/apex-coder-1.5b-lora")