Views
No views yet
Wan-AI/Wan2.2-T2V-A14BWan-AI/Wan2.2-T2V-A14B model. It reduces model size by 32% compared to the original BFloat16 model, while maintaining bit-identical outputs and supporting efficient GPU inference.Wan-AI/Wan2.2-T2V-A14B can now generate a 5-second 720P video on a single 24GB GPU, while maintaining full model quality. 🔥🔥🔥| Model | Model Size | Peak GPU Memory (5-second 720P generation) | Generation Time (A100 GPU) |
|---|---|---|---|
| Wan-AI/Wan2.2-T2V-A14B (BFloat16) | ~56 GB | O.O.M. | - |
| Wan-AI/Wan2.2-T2V-A14B (DFloat11) | 19.46 + 19.39 GB | 41.06 GB | 42 minutes |
| Wan-AI/Wan2.2-T2V-A14B (DFloat11 + CPU Offloading) | 19.46 + 19.39 GB | 22.49 GB | 44 minutes |
pip install -U dfloat11[cuda12]diffusers package from source:pip install git+https://github.com/huggingface/diffuserst2v.py:1import time
2import torch
3import argparse
4from diffusers import WanPipeline, AutoencoderKLWan
5from diffusers.utils import export_to_video
6from dfloat11 import DFloat11Model
7
8# Set up argument parser
9parser = argparse.ArgumentParser(description='Run Wan2.2 T2V model with custom parameters')
10parser.add_argument('--prompt', type=str, default="A serene koi pond at night, with glowing lanterns reflecting on the rippling water. Ethereal fireflies dance above as cherry blossoms gently fall, creating a dreamlike atmosphere.",
11 help='Text prompt for video generation')
12parser.add_argument('--negative_prompt', type=str, default="色调艳丽,过曝,静态,细节模糊不清,字幕,风格,作品,画作,画面,静止,整体发灰,最差质量,低质量,JPEG压缩残留,丑陋的,残缺的,多余的手指,画得不好的手部,画得不好的脸部,畸形的,毁容的,形态畸形的肢体,手指融合,静止不动的画面,杂乱的背景,三条腿,背景人很多,倒着走",
13 help='Negative prompt for video generation')
14parser.add_argument('--width', type=int, default=1280, help='Width of output video')
15parser.add_argument('--height', type=int, default=720, help='Height of output video')
16parser.add_argument('--num_frames', type=int, default=81, help='Number of frames to generate')
17parser.add_argument('--guidance_scale', type=float, default=4.0, help='Guidance scale for first stage')
18parser.add_argument('--guidance_scale_2', type=float, default=3.0, help='Guidance scale for second stage')
19parser.add_argument('--num_inference_steps', type=int, default=40, help='Number of inference steps')
20parser.add_argument('--cpu_offload', action='store_true', help='Enable CPU offloading')
21parser.add_argument('--output', type=str, default='t2v_out.mp4', help='Output video file path')
22parser.add_argument('--fps', type=int, default=16, help='FPS of output video')
23
24args = parser.parse_args()
25
26# Initialize models
27vae = AutoencoderKLWan.from_pretrained("Wan-AI/Wan2.2-T2V-A14B-Diffusers", subfolder="vae", torch_dtype=torch.float32)
28pipe = WanPipeline.from_pretrained("Wan-AI/Wan2.2-T2V-A14B-Diffusers", vae=vae, torch_dtype=torch.bfloat16)
29
30# Load DFloat11 models
31DFloat11Model.from_pretrained(
32 "DFloat11/Wan2.2-T2V-A14B-DF11",
33 device="cpu",
34 cpu_offload=args.cpu_offload,
35 bfloat16_model=pipe.transformer,
36)
37DFloat11Model.from_pretrained(
38 "DFloat11/Wan2.2-T2V-A14B-2-DF11",
39 device="cpu",
40 cpu_offload=args.cpu_offload,
41 bfloat16_model=pipe.transformer_2,
42)
43
44pipe.enable_model_cpu_offload()
45
46start_time = time.time()
47# Generate video
48output = pipe(
49 prompt=args.prompt,
50 negative_prompt=args.negative_prompt,
51 height=args.height,
52 width=args.width,
53 num_frames=args.num_frames,
54 guidance_scale=args.guidance_scale,
55 guidance_scale_2=args.guidance_scale_2,
56 num_inference_steps=args.num_inference_steps,
57).frames[0]
58print(f"Time taken: {time.time() - start_time:.2f} seconds")
59
60export_to_video(output, args.output, fps=args.fps)
61
62# Print memory usage
63max_memory = torch.cuda.max_memory_allocated()
64print(f"Max memory: {max_memory / (1000 ** 3):.2f} GB")PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True python t2v.pyPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True python t2v.py --cpu_offloadSettingPYTORCH_CUDA_ALLOC_CONF=expandable_segments:Trueis strongly recommended to prevent out-of-memory errors caused by GPU memory fragmentation.