Views
No views yet
| Backend | Quantization | Context Length | Prefill (tokens/sec) | Decode (tokens/sec) | Time-to-first-token (sec) | Model size (MB) | Peak RSS Memory (MB) | GPU Memory (MB) |
|---|---|---|---|---|---|---|---|---|
CPU | dynamic_int8 | 4096 | 166.50 tk/s | 26.35 tk/s | 6.41 s | 1831.43 MB | 2221 MB | N/A |
GPU | dynamic_int8 | 4096 | 927.54 tk/s | 26.98 tk/s | 5.46 s | 1831.43 MB | 2096 MB | 1659 MB |