This model is
google/functiongemma-270m-it converted to
MLX format optimized for Apple Silicon (M1/M2/M3/M4) Macs with native acceleration.
1from mlx_lm import load, generate
2
3# Load the model
4model, tokenizer = load("QuantLLM/functiongemma-270m-it-4bit-mlx")
5
6# Simple generation
7prompt = "Explain quantum computing in simple terms"
8messages = [{"role": "user", "content": prompt}]
9prompt_formatted = tokenizer.apply_chat_template(
10 messages,
11 add_generation_prompt=True
12)
13
14# Generate response
15text = generate(model, tokenizer, prompt=prompt_formatted, verbose=True)
16print(text)
1from mlx_lm import load, stream_generate
2
3model, tokenizer = load("QuantLLM/functiongemma-270m-it-4bit-mlx")
4
5prompt = "Write a haiku about coding"
6messages = [{"role": "user", "content": prompt}]
7prompt_formatted = tokenizer.apply_chat_template(
8 messages,
9 add_generation_prompt=True
10)
11
12# Stream tokens as they're generated
13for token in stream_generate(model, tokenizer, prompt=prompt_formatted, max_tokens=200):
14 print(token, end="", flush=True)
1# Install mlx-lm
2pip install mlx-lm
3
4# Generate text
5python -m mlx_lm.generate --model QuantLLM/functiongemma-270m-it-4bit-mlx --prompt "Hello!"
6
7# Interactive chat
8python -m mlx_lm.chat --model QuantLLM/functiongemma-270m-it-4bit-mlx
1# Install dependencies
2pip install mlx-lm