This variant (data-archetype/irdiffae-v1): 121.0M parameters, 461.4 MB.
1import torch
2from ir_diffae import IRDiffAE
3
4# Load from HuggingFace Hub (or a local path)
5model = IRDiffAE.from_pretrained("data-archetype/irdiffae-v1", device="cuda")
6
7# Encode
8images = ... # [B, 3, H, W] in [-1, 1], H and W divisible by 16
9latents = model.encode(images)
10
11# Decode (1 step by default — PSNR-optimal)
12recon = model.decode(latents, height=H, width=W)
13
14# Reconstruct (encode + 1-step decode)
15recon = model.reconstruct(images)
1from ir_diffae import IRDiffAEInferenceConfig
2
3# PSNR-optimal (fast, 1 step)
4cfg = IRDiffAEInferenceConfig(num_steps=1, sampler="ddim")
5recon = model.decode(latents, height=H, width=W, inference_config=cfg)
1@misc{irdiffae_v1,
2 title = {iRDiffAE: A Fast, Representation Aligned Diffusion Autoencoder with DiCo Blocks},
3 author = {data-archetype},
4 year = {2026},
5 month = feb,
6 url = {https://huggingface.co/data-archetype/irdiffae-v1},
7}