Also available: Edmon02/gemma-4-12B-it-GGUF for llama.cpp / LM Studio.
1pip install -U mlx-vlm huggingface_hub
2
3# Recommended quant (4bit)
4huggingface-cli download Edmon02/gemma-4-12B-it-MLX 4bit/ --local-dir ./models/gemma-4-12b-mlx
1python -m mlx_vlm.generate \
2 --model ./models/gemma-4-12b-mlx/4bit \
3 --prompt "List three benefits of encoder-free multimodal models." \
4 --max-tokens 256 --temperature 0.7
1from mlx_vlm import generate, load
2from mlx_vlm.prompt_utils import apply_chat_template
3
4model, processor = load("./models/gemma-4-12b-mlx/4bit")
5prompt = apply_chat_template(
6 processor,
7 model.config,
8 [{"role": "user", "content": "Hello!"}],
9 add_generation_prompt=True,
10)
11print(generate(model=model, processor=processor, prompt=prompt, max_tokens=256).text)
1python -m mlx_vlm.generate \
2 --model ./models/gemma-4-12b-mlx/4bit \
3 --prompt "Describe this image in one sentence." \
4 --image photo.jpg \
5 --max-tokens 128
1@article{gemma_2026,
2 title={Gemma 4},
3 author={Google DeepMind},
4 year={2026},
5 url={https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12B/}
6}