Views
No views yet
mlx-lm chat-style inference.mlx-lm library.pip install --upgrade mlx-lm1from mlx_lm import load, generate
2
3# Load the non-quantized MLX model.
4model, tokenizer = load("mlx-community/gemma-4-12b-coder-fable5-composer2.5")
5
6prompt = "Write a Python script to sort a dictionary by its values."
7messages = [{"role": "user", "content": prompt}]
8
9formatted_prompt = tokenizer.apply_chat_template(
10 messages,
11 tokenize=False,
12 add_generation_prompt=True,
13)
14
15response = generate(
16 model,
17 tokenizer,
18 prompt=formatted_prompt,
19 verbose=True,
20 max_tokens=1024,
21)1response = generate(
2 model,
3 tokenizer,
4 prompt=formatted_prompt,
5 verbose=True,
6 max_tokens=1024,
7 temp=0.0,
8)google/gemma-4-12B-ityuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1