The S3-DiT architecture concatenates text tokens, visual semantic tokens, and image VAE tokens at the sequence level as a unified input stream, maximizing parameter efficiency compared to dual-stream approaches.
Only 2D weight tensors from Linear layers are quantized. Normalization layers, biases, embeddings,
and position encodings remain in float16.
1import torch
2from diffusers import ZImagePipeline
3
4pipe = ZImagePipeline.from_pretrained(
5 "Tongyi-MAI/Z-Image-Turbo",
6 torch_dtype=torch.bfloat16,
7)
8pipe.to("cuda")
9
10prompt = "Young Chinese woman in red Hanfu, intricate embroidery, ancient temple backdrop"
11
12image = pipe(
13 prompt=prompt,
14 height=1024,
15 width=1024,
16 num_inference_steps=9, # Results in 8 DiT forwards
17 guidance_scale=0.0, # No CFG for Turbo models
18 generator=torch.Generator("cuda").manual_seed(42),
19).images[0]
20
21image.save("example.png")
1@article{z-image2025,
2 title={Z-Image: An Efficient Image Generation Foundation Model with Scalable Single Stream Diffusion Transformer},
3 author={Tongyi MAI Team},
4 journal={arXiv preprint arXiv:2511.22699},
5 year={2025}
6}
7
8@article{decoupled-dmd2025,
9 title={Decoupled Consistency Model Distillation},
10 author={Liu et al.},
11 journal={arXiv preprint arXiv:2511.22677},
12 year={2025}
13}
14
15@article{dmdr2025,
16 title={DMDR: Fusing DMD with Reinforcement Learning},
17 author={Jiang et al.},
18 journal={arXiv preprint arXiv:2511.13649},
19 year={2025}
20}