Views
No views yet
vjepa2-ac-vitg): a ViT-g
video encoder + an action-conditioned predictor that, given encoder context
tokens + per-frame 7-DoF robot poses (action/state), predicts future latent
states — the world-model used for robot planning. MIT.1from vjepa2_mlx.utils.weights import build_ac_encoder, build_ac_predictor
2enc = build_ac_encoder() # ViT-g encoder (hidden 1408, 40 layers)
3pred = build_ac_predictor() # AC predictor (frame-causal, 3D-RoPE)
4# tokens = enc(video); future = pred(tokens, actions, states)vjepa2-ac-vitg.pt.