Views
No views yet
| GPU | Run Type | FP8 it/s | FP8 Time (s) | INT8 it/s | INT8 Time (s) | Relative Speedup (%) |
|---|---|---|---|---|---|---|
| RTX5090 | First | 1.93 | 6.67 | 2.70 | 14.57 | -118% |
| RTX5090 | 2–5 avg | 2.21 | 3.25 | 1.75 | 3.20 | +3% |
| RTX3090 | First | 0.46 | 16.09 | 0.21 | 23.30 | -45% |
| RTX3090 | 2–5 avg | 0.48 | 11.98 | 0.58 | 7.76 | +35% |
| RTX3060 | First | 0.17 | 78.03 | 0.11 | 84.38 | -8% |
| RTX3060 | 2–5 avg | 0.20 | 38.96 | 0.25 | 28.42 | +27% |
| Mode | fp8 | int8 | bf16 |
|---|---|---|---|
| T2I | ![]() | ![]() | ![]() |
| EDIT | ![]() | ![]() | ![]() |
ComfyUI/custom_nodes.INT8.Load Diffusion Model INT8 (W8A8) node for model loading.Load LoRA INT8 nodes for Lora loading.pip install convert_to_quantconvert_to_quant -i models/flux-2-klein-4b.safetensors --int8 --block_size 128 --comfy_quant --flux2 --scaling_mode tensormodels/flux-2-klein-4b_learned_int8mixed_tensorwise.safetensors