Views
No views yet
diffusers library, ComfyUI, or any other model), although models that use architectures which are unfamiliar to me might be more difficult.diffusers1import torch
2from diffusers import LongCatImageEditPipeline, LongCatImageTransformer2DModel
3
4# for transformers version >=5.0.0
5# from transformers.initialization import no_init_weights
6
7# else
8from transformers.modeling_utils import no_init_weights
9
10with no_init_weights():
11 transformer = LongCatImageTransformer2DModel.from_config(
12 LongCatImageTransformer2DModel.load_config(
13 "meituan-longcat/LongCat-Image-Edit", subfolder="transformer"
14 ),
15 torch_dtype=torch.bfloat16
16 ).to(torch.bfloat16)
17DFloat11Model.from_pretrained(
18 "mingyi456/LongCat-Image-Edit-DF11",
19 device="cpu",
20 bfloat16_model=transformer,
21)
22pipe = LongCatImageEditPipeline.from_pretrained(
23 "meituan-longcat/LongCat-Image-Edit",
24 transformer=transformer,
25 torch_dtype=torch.bfloat16
26)
27DFloat11Model.from_pretrained(
28 "mingyi456/Qwen2.5-VL-7B-Instruct-DF11",
29 device="cpu",
30 bfloat16_model=pipe.text_encoder,
31)
32pipe.enable_model_cpu_offload()
33
34img = Image.open('assets/test.png').convert('RGB')
35prompt = '将猫变成狗'
36image = pipe(
37 img,
38 prompt,
39 negative_prompt='',
40 guidance_scale=4.5,
41 num_inference_steps=50,
42 num_images_per_prompt=1,
43 generator=torch.Generator("cpu").manual_seed(43)
44).images[0]
45
46image.save('image longcat-image-edit.png')pattern_dict for compression:1pattern_dict = {
2 r"transformer_blocks\.\d+": (
3 "norm1.linear",
4 "norm1_context.linear",
5 "attn.to_q",
6 "attn.to_k",
7 "attn.to_v",
8 "attn.to_out.0",
9 "attn.add_q_proj",
10 "attn.add_k_proj",
11 "attn.add_v_proj",
12 "attn.to_add_out",
13 "ff.net.0.proj",
14 "ff.net.2",
15 "ff_context.net.0.proj",
16 "ff_context.net.2",
17 ),
18 r"single_transformer_blocks\.\d+": (
19 "norm.linear",
20 "proj_mlp",
21 "proj_out",
22 "attn.to_q",
23 "attn.to_k",
24 "attn.to_v",
25 ),
26}