Views
No views yet
krea/Krea-2-Turbo transformer (DiT), made with NVIDIA TensorRT Model Optimizer (mtq.quantize + mtq.compress, calibrated on a small diverse prompt set at 768²).krea/Krea-2-Turbo's text_encoder (Qwen3-VL) + vae + tokenizer/scheduler.sakamakismile/Krea-2-Turbo-NVFP4-AWQ — ~7.2 GB W4A4 (AWQ-Lite), fits a single 16 GB card. Pick FP8 for fidelity, AWQ for size.



diffusers from source (Krea2Pipeline is 0.39-dev, not on PyPI yet) + nvidia-modelopt + a recent torch on Blackwell (FP8).1import torch
2import modelopt.torch.opt as mto
3from diffusers import Krea2Pipeline, Krea2Transformer2DModel
4
5BASE = "krea/Krea-2-Turbo"
6FP8 = "sakamakismile/Krea-2-Turbo-FP8" # local path or hf snapshot
7
8# rebuild the FP8 transformer from the modelopt state on the base structure
9t = Krea2Transformer2DModel.from_pretrained(BASE, subfolder="transformer", torch_dtype=torch.bfloat16, device_map="auto")
10mto.restore(t, f"{FP8}/modelopt_state.pth")
11
12pipe = Krea2Pipeline.from_pretrained(BASE, transformer=t, torch_dtype=torch.bfloat16).to("cuda")
13img = pipe("a fox in the snow", num_inference_steps=8, guidance_scale=0.0).images[0]
14img.save("out.png")modelopt_state.pth is the reliable reload (proven). diffusion_pytorch_model-*.safetensors is the save_pretrained form of the same quantized transformer.