Views
No views yet
| Precision Target | Disk Footprint | Peak VRAM | Quantized PPL | Brain Fidelity | Active Selection |
|---|---|---|---|---|---|
| 2-bit Precision | 0.51 GB | 0.57 GB | 639987.3113 | 0.0% | |
| 3-bit Precision | 0.71 GB | 0.77 GB | 50.5746 | 37.95% | |
| 4-bit Precision | 0.91 GB | 0.97 GB | 24.0658 | 79.75% | |
| 8-bit Precision | 1.71 GB | 1.77 GB | 19.3544 | 99.16% | 👈 (This Repo) |
19.1917Salesforce/WikiText-2 (Raw Validation Split)Full Dataset (212 Chunks)| Quant Format | 🟢 M-Series Base (~100 GB/s) | 🔵 M-Series Pro (~150-200 GB/s) | 🟣 M-Series Max (~300-400 GB/s) | 🔥 M-Series Ultra (~800 GB/s) | |
|---|---|---|---|---|---|
| 2-bit | 56.79 tok/s | 103.25 tok/s | 201.34 tok/s | 351.05 tok/s | |
| 3-bit | 55.61 tok/s | 101.11 tok/s | 197.16 tok/s | 343.77 tok/s | |
| 4-bit | 59.06 tok/s | 107.38 tok/s | 209.39 tok/s | 365.09 tok/s | |
| 8-bit | 41.26 tok/s | 75.02 tok/s | 146.29 tok/s | 255.07 tok/s | 👈 |
1from mlx_lm import load, generate
2model, tokenizer = load('model-rampage/Qwen3-1.7B-mlx-8bit')
3
4response = generate(
5 model,
6 tokenizer,
7 prompt="Your system prompt execution sequence goes here.",
8 max_tokens=128,
9 verbose=True
10)