Views
No views yet
| Prompt Length (tokens) | TTFT (ms) | ITL Avg (ms) | ITL Std (ms) | Prefill Time (ms) | Prefill Speed (tok/s) | Output Time (ms) | Decode Speed (tok/s) |
|---|---|---|---|---|---|---|---|
| 4,096 | 3,265 | 39.99 | 0.50 | 3,260 | 1,256 | 15,358 | 66.68 |
| 8,192 | 6,730 | 40.62 | 0.79 | 6,725 | 1,218 | 11,903 | 86.03 |
| 16,384 | 14,034 | 41.46 | 0.64 | 14,029 | 1,168 | 17,537 | 58.39 |
| 32,768 | 29,943 | 42.84 | 1.10 | 29,937 | 1,095 | 16,194 | 63.23 |
| 65,536 | 66,835 | 45.29 | 1.25 | 66,829 | 981 | 16,531 | 61.94 |
| 131,072 | 160,941 | 50.18 | 2.40 | 160,936 | 814 | 19,620 | 52.19 |
from vllm import LLMllm = LLM(
model="cjxzdzh/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP-GPTQ-INT4",
quantize="gptq",
tensor_parallel_size=2,
max_model_len=262144,
gpu_memory_utilization=0.93,
max_num_seqs=2,
)from gptqmodel import GPTQModel, QuantizeConfigmodel = GPTQModel.from_quantized(
"cjxzdzh/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP-GPTQ-INT4",
device_map="auto",
)