7.8k samples of metadata and encoded latents & prompts of random videos.
Video frame latents
Numpy arrays
120 frames, 512x512 source size
Encoded shape (120, 4, 64, 64)
CLIP (openai) encoded prompts
Video description (as seen in metadata)
Encoded shape (77,768)
Video metadata as JSON (description, tags, categories, source URL, etc.)