Views
No views yet
1# Standard generation
2mlx_vlm.generate \
3 --model StargazerLabs/Qwen3.8-32B-Jumbo-3bit \
4 --prompt "Your prompt here" --max-tokens 2048
5
6# With MTP speculative decoding (use 4-bit drafter; no 3-bit drafter exists)
7mlx_vlm.generate \
8 --model StargazerLabs/Qwen3.8-32B-Jumbo-3bit \
9 --draft-model mlx-community/Qwen3.8-27B-MTP-4bit \
10 --prompt "Your prompt here" --max-tokens 2048