Views
No views yet


model.py. No runtime hooks. No steering vectors. Just a standard MLX model that runs at full native speed.| Architecture | Qwen 3.5 MoE — 397B total params, 17B active per token |
| Quantization | 4-bit, group size 64 |
| Speed | ~37 tok/s on Mac Studio M3 Ultra (256GB) |
| Abliteration | Permanent weight-level modification |
| Custom files | None needed — works with stock mlx-lm |

1from mlx_lm import load, generate
2
3model, tokenizer = load("dealignai/Qwen3.5-397B-A17B-REAP-CRACK")
4prompt = tokenizer.apply_chat_template(
5 [{"role": "user", "content": "Your prompt here"}],
6 add_generation_prompt=True, tokenize=False, enable_thinking=False
7)
8response = generate(model, tokenizer, prompt=prompt, max_tokens=500)
9print(response)mlx-lm| Model | Description |
|---|---|
| Qwen 3.5 397B REAP (base) | Expert-pruned base (no abliteration) |
| INTELLECT 3.1 CRACK | INTELLECT 3.1 abliterated |
