1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model_name = "Qwen/Qwen3-30B-A3B-Instruct-2507"
5adapter_name = "HarleyCooper/Qwen3-30B-ThinkingMachines-Dakota1890"
6
7model = AutoModelForCausalLM.from_pretrained(
8 base_model_name,
9 device_map="auto",
10 torch_dtype="auto",
11 trust_remote_code=True,
12)
13tokenizer = AutoTokenizer.from_pretrained(base_model_name)
14model = PeftModel.from_pretrained(model, adapter_name)
15
16# Inference
17prompt = "Translate 'my elder brother' to Dakota using the correct possessive suffix."
18messages = [
19 {"role": "system", "content": "You are a Dakota language expert."},
20 {"role": "user", "content": prompt}
21]
22text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
23inputs = tokenizer(text, return_tensors="pt").to(model.device)
24
25outputs = model.generate(**inputs, max_new_tokens=128)
26print(tokenizer.decode(outputs[0], skip_special_tokens=True))
27
28# Alternatively:
29# from peft import AutoPeftModelForCausalLM
30# model = AutoPeftModelForCausalLM.from_pretrained(adapter_name, device_map="auto")
And the Thinking Machines / PrimeIntellect RL framework.