Views
No views yet
google/gemma-4-E2B-it-assistant using mlx-vlm version 0.4.5.
Refer to the original model card for more details on the model.pip install -U mlx-vlm--draft-block-size 6:1python -m mlx_vlm generate \
2 --model mlx-community/gemma-4-E2B-it-bf16 \
3 --draft-model mlx-community/gemma-4-E2B-it-assistant-bf16 \
4 --draft-kind mtp \
5 --draft-block-size 6 \
6 --prompt "Explain speculative decoding in 3 sentences." \
7 --max-tokens 256 --temperature 0--draft-block-size 3, use batch_generate:1from mlx_vlm.utils import load
2from mlx_vlm.generate import batch_generate
3from mlx_vlm.speculative.drafters import load_drafter
4
5model, processor = load("mlx-community/gemma-4-E2B-it-bf16")
6drafter = load_drafter("mlx-community/gemma-4-E2B-it-assistant-bf16", kind="mtp")
7
8prompts = [
9 "Explain speculative decoding in 3 sentences.",
10 "What is MLX?",
11 "Summarize attention in one paragraph.",
12 "List three prime numbers.",
13]
14
15response = batch_generate(
16 model,
17 processor,
18 prompts=prompts,
19 max_tokens=256,
20 temperature=0.0,
21 draft_model=drafter,
22 draft_kind="mtp",
23 draft_block_size=3,
24)
25for text in response.texts:
26 print(text)temperature=0.--draft-block-size: 6 for single requests, 3 for batched generation.