Views
No views yet

1from transformers import AutoModelForCausalLM, AutoTokenizer
2# Load the model (trust_remote_code=True is required for custom architecture)
3model = AutoModelForCausalLM.from_pretrained(
4 "MoLA-LLM/MoLA-v0.7-8x4b",
5 trust_remote_code=True,
6 device_map="auto"
7)
8tokenizer = AutoTokenizer.from_pretrained("MoLA-LLM/MoLA-v0.7-8x4b", trust_remote_code=True)
9# Use like any other language model - adapter selection is automatic
10prompt = "Write a Python function to calculate fibonacci numbers"
11messages = [{"role": "user", "content": prompt}]
12inputs = tokenizer.apply_chat_template(
13 messages,
14 add_generation_prompt=True,
15 tokenize=True,
16 return_dict=True,
17 return_tensors="pt",
18).to(model.device)
19outputs = model.generate(**inputs, max_new_tokens=8192, temperature=.6, do_sample=True)
20response = tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True)
21print(f"Selected LoRA: {model.get_current_lora()}")
22print(response)