Views
No views yet
Qwen/Qwen3.5-9B with native MTP (Multi-Token Prediction) heads for speculative decoding.| Component | Precision | Size |
|---|---|---|
| Main model (32 layers) | mxfp4 group_size=32 | ~4.60 GB |
| MTP decoder layer (x1) | mxfp4 (linear projections), bf16 (fc, norms) | ~0.25 GB |
pip install -U mlx-lm1python -m mlx_lm generate \
2 --model sleepyeldrazi/Qwen3.5-9B-MXFP4-MTP \
3 --max-tokens 100 \
4 --temperature 0.0 \
5 --prompt "Explain quantum computing in one sentence."--mtp flag with mlx-lm-mtp for ~24% faster generation.1python -m mlx_lm generate \
2 --model sleepyeldrazi/Qwen3.5-9B-MXFP4-MTP \
3 --mtp \
4 --max-tokens 200 \
5 --temperature 0.5 \
6 --prompt "Explain the theory of relativity."Qwen/Qwen3.5-9Bmlx_lm convert -q --q-group-size 32 --q-bits 4 --q-mode mxfp4