2-bit MLX weight-quantized build of
Qwen/Qwen3.5-397B-A17B (397B total / 17B active Sparse MoE, multimodal) —
re-quantized from the 4-bit TurboQuant MLX checkpoint for maximum compression. Optimized for Apple Silicon via
MLX.
1from mlx_lm import load, generate
2
3model, tokenizer = load("majentik/Qwen3.5-397B-A17B-TurboQuant-MLX-2bit")
4
5prompt = tokenizer.apply_chat_template(
6 [{"role": "user", "content": "Give me a one-sentence description of MoE routing."}],
7 add_generation_prompt=True,
8)
9print(generate(model, tokenizer, prompt=prompt, max_tokens=128, verbose=True))