Views
No views yet
| Property | Value |
|---|---|
| Original model | OpenMOSE/Qwen3.5-REAP-97B-A10B |
| Base model | Qwen/Qwen3.5-122B-A10B |
| Architecture | qwen3_5_moe (Decoder-only Transformer, hybrid linear/full attention + MoE) |
| Total parameters | ~97B (pruned from 122B via REAP) |
| Active parameters | ~10B per token (8 experts per token) |
| MoE experts | 200 (pruned from 256) |
| Num layers | 48 |
| Hidden size | 3072 |
| Attention | Hybrid (3x linear + 1x full, repeating every 4 layers) |
| Max context length | 262,144 tokens |
| Quantization | 4-bit (affine, group size 64), gates kept at 8-bit |
| Model size on disk | ~51 GB |
| License | Apache 2.0 |
pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("mlx-community/Qwen3.5-REAP-97B-A10B-4bit")
4
5prompt = "Explain the theory of relativity in simple terms."
6messages = [{"role": "user", "content": prompt}]
7text = tokenizer.apply_chat_template(
8 messages, tokenize=False, add_generation_prompt=True
9)
10
11response = generate(model, tokenizer, prompt=text, max_tokens=512)
12print(response)1mlx_lm.generate \
2 --model mlx-community/Qwen3.5-REAP-97B-A10B-4bit \
3 --prompt "What is 2+2?" \
4 --max-tokens 256mlx_lm.convert with -q --q-bits 4