Views
No views yet
| Precision Target | Disk Footprint | Peak VRAM | Quantized PPL | Brain Fidelity | Active Selection |
|---|---|---|---|---|---|
| 2-bit Precision | 0.18 GB | 0.23 GB | 940136.3923 | 0.0% | |
| 3-bit Precision | 0.25 GB | 0.3 GB | 74.1441 | 33.3% | |
| 4-bit Precision | 0.32 GB | 0.37 GB | 29.5427 | 83.57% | |
| 8-bit Precision | 0.6 GB | 0.65 GB | 24.7516 | 99.75% | 👈 (This Repo) |
24.6901Salesforce/WikiText-2 (Raw Validation Split)Full Dataset (212 Chunks)| Quant Format | 🟢 M-Series Base (~100 GB/s) | 🔵 M-Series Pro (~150-200 GB/s) | 🟣 M-Series Max (~300-400 GB/s) | 🔥 M-Series Ultra (~800 GB/s) | |
|---|---|---|---|---|---|
| 2-bit | 104.71 tok/s | 190.39 tok/s | 371.26 tok/s | 647.33 tok/s | |
| 3-bit | 101.29 tok/s | 184.16 tok/s | 359.11 tok/s | 626.14 tok/s | |
| 4-bit | 106.18 tok/s | 193.05 tok/s | 376.45 tok/s | 656.37 tok/s | |
| 8-bit | 86.56 tok/s | 157.38 tok/s | 306.89 tok/s | 535.09 tok/s | 👈 |
1from mlx_lm import load, generate
2model, tokenizer = load('model-rampage/Qwen3-0.6B-mlx-8bit')
3
4response = generate(
5 model,
6 tokenizer,
7 prompt="Your system prompt execution sequence goes here.",
8 max_tokens=128,
9 verbose=True
10)