Views
No views yet
mlx-vlm speculative decoding.| Property | Value |
|---|---|
| Base Model | empero-ai/Qwythos-9B-Claude-Mythos-5-1M |
| Source GGUF | Qwythos-9B-Claude-Mythos-5-1M-MTP-BF16.gguf (17GB) |
| MLX Format | bfloat16 / float32 |
| Architecture | Qwen3.5 MTP Draft Model |
| Context Length | 1,048,576 tokens (1M) |
| Layers | 32 (main) + 1 MTP layer |
| Hidden Size | 4096 |
| Intermediate Size | 12288 |
| Attention Heads | 16 |
| KV Heads | 4 |
| Head Dim | 256 |
| RoPE | YARN, partial_rotary_factor=0.25, factor=4.0 |
| Block Size | 3 |
| MTP Num Hidden Layers | 1 |
| Weight Count | 15 tensors |
| Weight Size | ~464 MB |
blk.32.nextn.*) and the MTP attention/FFN blocks from the original model, producing a standalone qwen3_5_mtp compatible drafter.1mlx_vlm.generate \
2 --model /path/to/Qwythos-9B-Claude-Mythos-5-1M-MLX-bf16 \
3 --draft-model /path/to/Qwythos-9B-Claude-Mythos-5-1M-MLX-bf16-mtp-draft \
4 --draft-kind mtp1from mlx_vlm import load_model, generate
2from mlx_vlm.utils import load_prompt_cache
3
4model = load_model("/path/to/Qwythos-9B-Claude-Mythos-5-1M-MLX-bf16")
5draft_model = load_model("/path/to/Qwythos-9B-Claude-Mythos-5-1M-MLX-bf16-mtp-draft")
6
7# Use draft_model with --draft-kind mtp equivalent| Key | Shape | Dtype |
|---|---|---|
fc.weight | (4096, 8192) | bfloat16 |
layers.0.input_layernorm.weight | (4096,) | float32 |
layers.0.post_attention_layernorm.weight | (4096,) | float32 |
layers.0.self_attn.q_proj.weight | (8192, 4096) | bfloat16 |
layers.0.self_attn.k_proj.weight | (1024, 4096) | bfloat16 |
layers.0.self_attn.v_proj.weight | (1024, 4096) | bfloat16 |
layers.0.self_attn.o_proj.weight | (4096, 4096) | bfloat16 |
layers.0.self_attn.q_norm.weight | (256,) | float32 |
layers.0.self_attn.k_norm.weight | (256,) | float32 |
layers.0.mlp.gate_proj.weight | (12288, 4096) | bfloat16 |
layers.0.mlp.up_proj.weight | (12288, 4096) | bfloat16 |
layers.0.mlp.down_proj.weight | (4096, 12288) | bfloat16 |
norm.weight | (4096,) | float32 |
pre_fc_norm_embedding.weight | (4096,) | float32 |
pre_fc_norm_hidden.weight | (4096,) | float32 |
Qwythos-9B-Claude-Mythos-5-1M-MTP-BF16.gguf) parsed for MTP tensors at blk.32mtp.* format for mlx-vlm splittermlx_vlm.speculative.drafters.qwen3_5_mtp.split applied to produce final drafterstrict=True load against Qwen3_5MTPDraftModel