Views
No views yet
1from diffusers import DiffusionPipeline
2import torch
3
4pipeline = DiffusionPipeline.from_pretrained(
5 "jiuntian/interactdiffusion-xl-1024",
6 trust_remote_code=True,
7 variant="fp16", torch_dtype=torch.float16
8)
9pipeline = pipeline.to("cuda")
10
11images = pipeline(
12 prompt="a person is feeding a cat",
13 interactdiffusion_subject_phrases=["person"],
14 interactdiffusion_object_phrases=["cat"],
15 interactdiffusion_action_phrases=["feeding"],
16 interactdiffusion_subject_boxes=[[0.0332, 0.1660, 0.3359, 0.7305]],
17 interactdiffusion_object_boxes=[[0.2891, 0.4766, 0.6680, 0.7930]],
18 interactdiffusion_scheduled_sampling_beta=1,
19 output_type="pil",
20 num_inference_steps=50,
21 ).images
22
23images[0].save('out.jpg')1@inproceedings{hoe2023interactdiffusion,
2 title={InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models},
3 author={Jiun Tian Hoe and Xudong Jiang and Chee Seng Chan and Yap-Peng Tan and Weipeng Hu},
4 year={2024},
5 booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
6}