Important: Keefe-Discere is an independent model project and is not an official Qwen model.
1import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM
3from peft import PeftModel
4
5# 1. Load the merged base model
6base_model_id = "KeefeBuild/Keefe-Discere"
7tokenizer = AutoTokenizer.from_pretrained(base_model_id)
8base_model = AutoModelForCausalLM.from_pretrained(
9 base_model_id, torch_dtype=torch.bfloat16, device_map="auto"
10)
11
12# 2. Attach the v1.1 LoRA adapter for enhanced coding/tool use
13model = PeftModel.from_pretrained(base_model, base_model_id)
14
15messages = [
16 {"role": "system", "content": "You are Keefe-Discere. Write clean Python code and use print() to output final answers."},
17 {"role": "user", "content": "Calculate the sum of the first 15 prime numbers."}
18]
19
20inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
21outputs = model.generate(inputs, max_new_tokens=512, temperature=0.1)
22print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))