Views
No views yet
Qwen/Qwen-Image.
It only replaces the transformer weights; tokenizer, scheduler, VAE, and other non-transformer components are loaded from the original base model.1sglang generate \
2 --backend=sglang \
3 --model-id=Qwen-Image \
4 --model-path Qwen/Qwen-Image \
5 --transformer-path BBuf/Qwen-Image-ModelOpt-FP8-SGLang \
6 --prompt "A futuristic cyberpunk city at night, neon lights reflecting on wet streets" \
7 --width=1024 \
8 --height=1024 \
9 --num-inference-steps=50 \
10 --guidance-scale=4.0 \
11 --seed=42 \
12 --num-gpus=1 \
13 --dit-cpu-offload false \
14 --dit-layerwise-offload false \
15 --warmup \
16 --save-output--backend=sglang. The FP8 image below is from the fixed checkpoint after keeping the validated sensitive Qwen Image fallback tensors in BF16.validation/validation/commands/bf16_qwen_image_1024_50_benchmark.shvalidation/commands/fp8_fixed_qwen_image_1024_50_benchmark.shqwen_image_bf16_vs_fp8_fixed_1024_50_compare.md| BF16, 1024x1024, 50 steps | FP8 fixed, 1024x1024, 50 steps |
|---|---|
![]() | ![]() |
| Metric | BF16 | FP8 fixed | Delta | Speedup |
|---|---|---|---|---|
| E2E latency | 13.589 s | 12.159 s | -1.430 s (-10.5%) | 1.12x |
| Denoising stage | 12.929 s | 11.437 s | -1.491 s (-11.5%) | 1.13x |
| Decoding stage | 58.55 ms | 52.30 ms | -6.25 ms (-10.7%) | 1.12x |
| Text encoding | 599.85 ms | 666.43 ms | +66.57 ms (+11.1%) | 0.90x |
A futuristic cyberpunk city at night, neon lights reflecting on wet streets.1024x1024, 50 inference steps, guidance_scale=4.0, seed=42, --dit-cpu-offload false, --dit-layerwise-offload false, --warmup.build_modelopt_fp8_transformer tool.
Most linear weights are FP8. The validated fallback set keeps numerically sensitive tensors in BF16, including the Qwen Image image-MLP output projection family needed for normal image quality.