Views
No views yet
| File | What |
|---|---|
unet.safetensors | SD1.x UNet2DConditionModel (in=8, out=4, cross_attn=384), single-step t=0 |
vae.safetensors | sd-vae-ft-mse AutoencoderKL (fp16) |
whisper_encoder.safetensors | whisper-tiny audio encoder (fp16) |
config.json | dtype / quantization / scaling factor |
1from musetalk_mlx.pipeline_mlx import MuseTalkPipeline
2pipe = MuseTalkPipeline.from_pretrained_mlx("MuseTalk-1.5-MLX-fp16")
3# crop_bgr: a 256x256 face crop; chunks: (N,50,384) whisper audio features
4latents = pipe.get_latents_for_unet(crop_bgr)
5faces = pipe.generate_faces(latents, audio_chunks) # BGR uint8 lip-synced faces