Views
No views yet
1step-100000.safetensors joint VAM checkpoint at 100k steps
2model_config.json architecture and data/preprocessing contract
3training_config.yaml training configuration snapshot
4action_stats.npy EEF/action normalization stats used by training
5training_log_node0.txt rank/node 0 training log
6training_log_node1.txt rank/node 1 training log
7README.md this model card1ee0863eb4a7096bd90bdd4fd744d336f496688edf58036cf635fccfe96cd937action_dit.* ActionMoT weights. The Wan2.2-TI2V-5B base assets are not bundled.1run directory: src/vam/models/train/vam_icl/paired_v3_alltasks_mv_mot_ti2v5b_16g_100k_v2_ref_openwam_eef_fastwam_warmstart_refdrop03_relaunch_20260521-234642
2wandb run: run-20260522_075220-32gb6xg7
3wandb run name: paired_v3_train_mv_mot_ti2v5b_16g_100k_mask_v2_openwam_0522_0748
4checkpoint: step-100000.safetensors
5dataset: RoboTwin ICL-paired v3
6target robot: arx-x5
7task split: 20 train tasks
8episodes/task: 150 train episodes
9backbone: Wan2.2-TI2V-5B
10action stream: 30-layer ActionMoT, OpenWAM/FastWAM warm-start style
11reference mode: enabled, cross-embodiment full reference video
12reference dropout: 0.3
13multiview: enabled, RoboTwin head + left wrist + right wrist layout
14mask variant: v21action_space: eef
2proprio_space: action
3action_dim: 16
4proprio_dim: 16
5action_format: absoluteaction_stats.npy for normalization/denormalization.1raw action window: 33 frames
2action horizon: 32 actions
3action_video_freq_ratio: 4
4target video frames: 9 frames sampled at raw indices [0, 4, ..., 32]
5resolution: 384 x 320
6resize mode: stretch
7multiview layout: head camera on top, left/right wrist cameras below
8full reference video: enabled
9max reference frames: 41
10reference subsample factor: 4
11paired reference: false1action_dim=16
2proprio_dim=16
3num_frames=9
4action_horizon=32
5height=384
6width=320
7multiview=true
8action_space=eef
9proprio_space=action
10disable_reference_video=false
11full_reference_video=true
12max_ref_frames=41
13ref_subsample_factor=41[val_id step 100000] 20/98741 samples: loss=0.096612, loss_video=0.087265, loss_action=0.009346
2[val_id step 100000] task=grab roller action_MSE=0.008076 action_MAE=0.025867 video_MSE=2476.98 PSNR=18.62 SSIM=0.7764 LPIPS=0.2472src/vam/examples/wanvideo/human2robot/train_video_action.py.