Views
No views yet
Qwen/Qwen3.6-35B-A3B using mlx-lm.mlx-community/Qwen3.6-35B-A3B-4bit.| Quantization | c=1 tok/s | c=3 tok/s (per-req) | c=3 agg tok/s |
|---|---|---|---|
| 4-bit MLX | 90.8 | 37.7 | 162.7 |
| BF16 MLX (this) | 50.3 | 27.7 | 118.2 |
pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("Vaynel/Qwen3.6-35B-A3B-BF16-MLX")
4response = generate(model, tokenizer, prompt="Write a binary search in Python.", max_tokens=512)
5print(response)