Views
No views yet
Step-3.7-Flash (local model).
It was quantized locally using the mlx_lm library.down_proj in the first 5 layers is kept at higher quality (6-bit).down_proj every 5th layer is medium quality (5-bit).config.json, so it reflects exactly what was quantized.lm_head, routers, norms, dense MLPs) are kept at 8-bit or full precision as the high-precision backbone.| Module pattern | Bits | Count |
|---|---|---|
language_model.lm_head | 8-bit | 1 |
language_model.model.embed_tokens | 8-bit | 1 |
language_model.model.layers.{i}.mlp.down_proj | 8-bit | 3 |
language_model.model.layers.{i}.mlp.gate.gate | 8-bit | 42 |
language_model.model.layers.{i}.mlp.gate_proj | 8-bit | 3 |
language_model.model.layers.{i}.mlp.share_expert.down_proj | 4-bit | 32 |
language_model.model.layers.{i}.mlp.share_expert.down_proj | 5-bit | 8 |
language_model.model.layers.{i}.mlp.share_expert.down_proj | 6-bit | 2 |
language_model.model.layers.{i}.mlp.share_expert.gate_proj | 4-bit | 42 |
language_model.model.layers.{i}.mlp.share_expert.up_proj | 4-bit | 42 |
language_model.model.layers.{i}.mlp.switch_mlp.down_proj | 4-bit | 32 |
language_model.model.layers.{i}.mlp.switch_mlp.down_proj | 5-bit | 8 |
language_model.model.layers.{i}.mlp.switch_mlp.down_proj | 6-bit | 2 |
language_model.model.layers.{i}.mlp.switch_mlp.gate_proj | 4-bit | 42 |
language_model.model.layers.{i}.mlp.switch_mlp.up_proj | 4-bit | 42 |
language_model.model.layers.{i}.mlp.up_proj | 8-bit | 3 |
language_model.model.layers.{i}.self_attn.g_proj | 8-bit | 45 |
language_model.model.layers.{i}.self_attn.k_proj | 8-bit | 45 |
language_model.model.layers.{i}.self_attn.o_proj | 8-bit | 45 |
language_model.model.layers.{i}.self_attn.q_proj | 8-bit | 45 |
language_model.model.layers.{i}.self_attn.v_proj | 8-bit | 45 |