Views
No views yet
| This model | FP16 baseline | |
|---|---|---|
| Decode tok/s (steady-state) | 205.03 | 77.32 |
| Prefill tok/s (steady-state) | 450.86 | 227.43 |
| Decode tok/s (avg, long traces) | 196.26 | 76.34 |
| Peak memory (GB) | 4.893 | 17.142 |
| Disk size (MB) | 4308 | 16169 |
Warmed, short-prompt, chat-templated, thinking disabled. Represents steady-state decode for typical chat use; long thinking traces will be slower due to KV-cache growth.
| Benchmark | This model | FP16 baseline | n |
|---|---|---|---|
| MATH-500 (math reasoning) | 56.7% (answered 23/30) | 70.0% (answered 25/30) | 30 |
| IFEval (instruction following) | 77.3% | 79.5% | 44 |
| HumanEval (code, pass@1) | 73.3% | 73.3% | 30 |
| Level | This model | FP16 baseline |
|---|---|---|
| level 1 | 83.3% | 83.3% |
| level 2 | 83.3% | 100.0% |
| level 3 | 50.0% | 50.0% |
| level 4 | 66.7% | 66.7% |
| level 5 | 0.0% | 50.0% |
| Context length | Decode tok/s |
|---|---|
| ~128 tokens | 206.1 |
| ~256 tokens | 205.4 |
| ~512 tokens | 205.6 |
| ~1024 tokens | 204.5 |
pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("sahilchachra/lfm2-5-8b-a1b-mxfp4-mlx")
4response = generate(model, tokenizer, prompt="Your prompt here", max_tokens=256, verbose=True)| Model | Variant |
|---|---|
| sahilchachra/lfm2-5-8b-a1b-mxfp4-mlx | Block float MX FP4 ← this model |
| sahilchachra/lfm2-5-8b-a1b-optiq-5bpw-mlx | OptiQ mixed-precision (target 5.0 bpw) |