Views
No views yet
| Device | RAM | Experience |
|---|---|---|
| Any M-series Mac (8GB+) | ~3GB | ✅ Runs everywhere |
| M1 MacBook Air (8GB) | ~3GB | ✅ Comfortable |
| M3 Max / Pro | ~3GB | ✅ Near-instant responses |
| iPhone 15 Pro (via MLX) | ~3GB | ✅ Runs on-device |
pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("Rapid42/Qwen3.5-4B-MXFP4")
4
5messages = [{"role": "user", "content": "Write a bash script to batch rename EXR files."}]
6prompt = tokenizer.apply_chat_template(
7 messages, add_generation_prompt=True, return_dict=False
8)
9
10response = generate(model, tokenizer, prompt=prompt, max_tokens=256, verbose=True)
11print(response)mlx_lm.chat --model Rapid42/Qwen3.5-4B-MXFP4| Use Case | Recommended |
|---|---|
| Quick code snippets | ✅ 4B (fast) |
| Complex reasoning / long-form | ❌ Use 27B or 35B-A3B |
| Always-on background assistant | ✅ 4B (low overhead) |
| Multilingual tasks | ⚠️ 4B is decent, larger is better |
| RAG / retrieval + answer | ✅ 4B works well with good context |