Views
No views yet
| Backend | Quantization scheme | Context length | Prefill (tokens/sec) | Decode (tokens/sec) | Time-to-first-token (sec) | Model size (MB) | Peak RSS Memory (MB) | GPU Memory (RSS in MB) | |
|---|---|---|---|---|---|---|---|---|---|
CPU | fp32 (baseline) | 1280 | 49.50 | 10 tk/s | 21.25 s | 6182 MB | 6254 MB | N/A | |
CPU | dynamic_int8 | 1280 | 297.58 | 34.25 tk/s | 3.71 s | 1598 MB | 1997 MB | N/A | |
CPU | dynamic_int8 | 4096 | 162.72 tk/s | 26.06 tk/s | 6.57 s | 1598 MB | 2216 MB | N/A | |
GPU | dynamic_int8 | 1280 | 1667.75 tk/s | 30.88 tk/s | 3.63 s | 1598 MB | 1846 MB | 1505 MB | |
GPU | dynamic_int8 | 4096 | 933.45 tk/s | 27.30 tk/s | 4.77 s | 1598 MB | 1869 MB | 1505 MB |