Views
No views yet

rgb0->rgb1, or it can include explicit control handles such as
optical flow, depth, camera motion, and partially specified future frames. The
same predictor handles all of these notations.| Prompt | What PSI Does |
|---|---|
rgb0->rgb1 | continue a scene one frame forward |
rgb0->f01,rgb1 | imagine motion and render the next frame |
rgb0,f01->f01,rgb1 | densify a sparse flow prompt, then render |
rgb0,d0,f01->f01,d1,rgb1 | use depth and motion to predict flow, depth, and RGB |
rgb0,c01->rgb1 | synthesize a new camera view |
1from PIL import Image
2from transformers import AutoModel
3
4predictor = AutoModel.from_pretrained(
5 "StanfordNeuroAILab/psi0_5",
6 trust_remote_code=True,
7 device="cuda:0",
8)
9rgb1 = predictor.generate("rgb0->rgb1", rgb0=Image.open("scene.png"))
10rgb1.save("scene_next.png")1f01 = predictor.sparse_flow_prompt([((70, 221), (168, 221))], rgb0.size)
2
3dense_flow, rgb1 = predictor.generate(
4 "rgb0,f01->f01,rgb1",
5 rgb0=rgb0,
6 f01=f01,
7 num_seq_patches=256,
8)1camera = {
2 "fov_x": 60.0,
3 "fov_y": 60.0,
4 "euler_angles": [0.0, -0.12, 0.0],
5 "translation": [0.10, 0.0, 0.04],
6}
7
8rgb1 = predictor.generate(
9 "rgb0,c01->rgb1",
10 rgb0=Image.open("coffee_mug_000.png"),
11 c01=camera,
12)docs/usage.mdhttps://neuroailab.github.io/psi-website/blog/psi-generations.htmltop_p=0.9, top_k=1000 for RGB rendering. Correct prompting
can significantly improve generations, and simple harnesses such as those in the
provided Gradio app can be used to steer the model much more effectively. We
believe this direction has great potential for scaling to create even more
comprehensive models of the world while maintaining this highly controllable
API.