Views
No views yet
| Variant | DiT Size | Total Size | Notes |
|---|---|---|---|
fp32/ | 11.76 GB | ~13.9 GB | Full precision |
fp16/ | 5.88 GB | ~8.0 GB | Half precision (recommended) |
| File | Description | FP32 Size | FP16 Size |
|---|---|---|---|
dacvae_encoder.onnx | Audio encoder (48kHz → latent) | 110 MB | 110 MB |
dacvae_decoder.onnx | Audio decoder (latent → 48kHz) | 320 MB | 320 MB |
t5_encoder.onnx | Text encoder (T5-base) | 440 MB | 440 MB |
dit_single_step.onnx | DiT denoiser (3B params) | 11.76 GB | 5.88 GB |
vision_encoder.onnx | Vision encoder (CLIP-based) | 1.27 GB | 1.27 GB |
tokenizer/ | SentencePiece tokenizer files | - | - |
1pip install onnxruntime sentencepiece torchaudio torchvision torchcodec soundfile
2# For CUDA support (recommended for large model):
3pip install onnxruntime-gpu1python onnx_inference.py \
2 --video input.mp4 \
3 --text "a person speaking" \
4 --model-dir fp16 \
5 --output target.wav \
6 --output-residual residual.wav1python onnx_inference.py \
2 --video input.mp4 \
3 --text "keyboard typing" \
4 --model-dir fp32 \
5 --output target.wav1python onnx_inference.py \
2 --audio input.wav \
3 --text "drums" \
4 --model-dir fp16 \
5 --output drums.wav1python -m onnx_export.export_dit \
2 --output-dir ./my_models \
3 --model-id facebook/sam-audio-large \
4 --fp16 \
5 --device cuda1python -m onnx_export.export_dacvae --output-dir ./my_models --model-id facebook/sam-audio-large
2python -m onnx_export.export_t5 --output-dir ./my_models --model-id facebook/sam-audio-large
3python -m onnx_export.export_vision --model facebook/sam-audio-large --output ./my_models