Views
No views yet
E4M3 (OCP e4m3fn fp8) for llama.cpp.
Test model for the CPU e4m3 quant type.cloudhands/fp8-cpu, HEAD 8a02ad204):llama-quantize qwen2.5-1.5b-f16.gguf qwen2.5-1.5b-e4m3.gguf E4M3| type | size | PPL | vs f16 | Mean KLD | Median KLD | Max KLD | same-top-token |
|---|---|---|---|---|---|---|---|
| f16 | 2.88 GiB | 10.134 | - | - | - | - | - |
| q8_0 | 1.53 GiB | 10.168 | +0.33% | 0.00200 | 0.00158 | 0.213 | 97.33% |
| e4m3 | 1.48 GiB | 10.248 | +1.12% | 0.01146 | 0.00937 | 0.846 | 93.64% |
| type | pp512 (t/s) | tg128 (t/s) |
|---|---|---|
| f16 | 528.3 | 19.2 |
| q8_0 | 499.3 | 33.1 |
| e4m3 | 253.2 | 34.6 |