Views
No views yet
| Component | Details |
|---|---|
| Video backbone | Spatial-Temporal DiT · 16 blocks · dim=1024 · 16 heads |
| Video VAE | 4-level encoder/decoder · latent_ch=4 · stride-8 |
| Text encoder | 6-layer transformer · dim=768 · BPE vocab=49408 |
| Audio decoder | 8-block mel-spectrogram DiT · dim=512 |
| Total | ~726.2M params |
1from vspark_pipeline import VSparkPipeline
2pipe = VSparkPipeline.from_pretrained("AyaanAhmed123/Vspark")
3frames, audio_mel = pipe("A golden sunset over ocean waves", num_inference_steps=50)python train_colab.py --data_dir /path/to/videos --epochs 50