Views
No views yet
GR00T_SKIP_VIDEO_DECODE=1). The model conditions on 6-DOF Z1 joint state + language. A vision-conditioned successor (V2) is trained on real rendered video — see "Successor".nvidia/GR00T-N1.7-3B (3.14 B params, AlternateVLDiT diffusion head)--tune-projector --tune-diffusion-model --no-tune-llm (no --tune-visual)EmbodimentTag.NEW_EMBODIMENT (custom modality config)z1_eef_delta (6) + z1_gripper (2) — relative joint deltas| Setup | Cube max lift | Success |
|---|---|---|
| Teacher-forced state, kinematic magnet gripper | 0.798 m | ✅ |
| Fully autoregressive state, kinematic magnet | 0.738 m | ✅ |
Inside warehouse.usd + PhysX FixedJoint gripper | 0.134 m | ✅ (max_lift > 0.05 m) |
checkpoint-5000/ — final HF Trainer checkpoint folder (config + model shards + processor + experiment_cfg)Gr00tPolicy(...) from the Isaac-GR00T SDK1import sys
2sys.path.insert(0, "/path/to/Isaac-GR00T")
3import modality_config_z1 # registers EmbodimentTag.NEW_EMBODIMENT
4
5from gr00t.policy import Gr00tPolicy
6from gr00t.data.embodiment_tags import EmbodimentTag
7
8policy = Gr00tPolicy(
9 embodiment_tag=EmbodimentTag.NEW_EMBODIMENT,
10 model_path="m3/go2z1-grasp-gr00t-n17-v1/checkpoint-5000",
11 device=0,
12 strict=False,
13)
14
15obs = {
16 "state": {"z1_joint_pos": z1_joint_pos[None, None, :]}, # (1, 1, 6)
17 "video": {vk: zeros((1, 1, 64, 64, 3), dtype=uint8)
18 for vk in policy.modality_configs["video"].modality_keys},
19 "language": {"annotation.human.task_description": [["pick up the cube"]]},
20}
21action, _ = policy.get_action(obs)
22# action keys: 'z1_eef_delta' (6), 'z1_gripper' (2)stage4_joint_eval/gr00t_warehouse_physical_grasp.py.meta/info.json, meta/episodes.jsonl, meta/modality.json, data/chunk-XXX/episode_*.parquet, videos/chunk-XXX/{base_cam,wrist_cam}/episode_*.mp4go2_z1_warehouse/stage2_grasp_data/json_to_lerobot.py1@misc{go2z1-grasp-gr00t-n17-v1,
2 title = {Z1 Grasp GR00T N1.7-3B Fine-tune V1 (state-only)},
3 author = {m3},
4 year = {2026},
5 url = {https://huggingface.co/m3/go2z1-grasp-gr00t-n17-v1}
6}m3/go2z1-grasp-gr00t-vision-v2 (see V2 dataset above).