Views
No views yet

1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3# Load the model (trust_remote_code=True is required for custom architecture)
4model = AutoModelForCausalLM.from_pretrained(
5 "MoLA-LLM/MoLA-v0.5-9x4b",
6 trust_remote_code=True,
7 device_map="auto"
8)
9tokenizer = AutoTokenizer.from_pretrained("MoLA-LLM/MoLA-v0.5-9x4b", trust_remote_code=True)
10
11# Use like any other language model - adapter selection is automatic
12prompt = "Write a Python function to calculate fibonacci numbers"
13messages = [{"role": "user", "content": prompt}]
14inputs = tokenizer.apply_chat_template(
15 messages,
16 add_generation_prompt=True,
17 tokenize=True,
18 return_dict=True,
19 return_tensors="pt",
20).to(model.device)
21
22outputs = model.generate(**inputs, max_new_tokens=8192, temperature=.6, do_sample=True)
23response = tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True)
24
25print(f"Selected LoRA: {model.get_current_lora()}")
26print(response)