Views
No views yet
| Backend | Quantization scheme | Context length | Prefill (tokens/sec) | Decode (tokens/sec) | Time-to-first-token (sec) | Model size (MB) | Peak RSS Memory (MB) | GPU Memory (MB) |
|---|---|---|---|---|---|---|---|---|
CPU | dynamic_int8 | 4096 | 66.53 tk/s | 7.28 tk/s | 15.90 s | 3906 MB | 5308 MB | N/A |
GPU | dynamic_int8 | 4096 | 314.01 tk/s | 10.39 tk/s | 10.32 s | 3906 MB | 4107 MB | 4608 MB |