Views
No views yet
genie-inference-maniskill/
├── genie_envisioner/ # GE-Act inference code
│ ├── models/ # MVActorModel architecture
│ ├── runner/ # Inference runner (rollout loop)
│ ├── utils/ # Shared utilities
│ ├── configs/
│ │ └── ltx_model/conflict/ # Per-experiment configs + action stats
│ ├── conflict_main.py # Main rollout script (single pair or batch)
│ ├── run_ood_experiment_inference.sh # Batch OOD evaluation script
│ ├── setup_maniskill_env.sh # Conda environment setup
│ ├── requirements.txt # Python dependencies
│ └── eval_conflict.md # Detailed evaluation guide
│
└── maniskill_conflict/ # ManiSkill conflict environment
├── mani_skill/ # Modified ManiSkill package
│ ├── envs/tasks/ # VerbObjectColor-v1 conflict task
│ └── assets/ # Robot and scene assets
├── conflict_experiment/ # Experiment utilities (pair generation, etc.)
├── setup.py
└── pyproject.toml1git clone https://huggingface.co/yqi19/genie-inference-maniskill
2cd genie-inference-maniskill1bash genie_envisioner/setup_maniskill_env.sh
2conda activate genie_envisionergit clone https://huggingface.co/Lightricks/LTX-Video /path/to/LTX-Video<experiment>/step_<N>/ directories containing
config.json and diffusion_pytorch_model.safetensors. For example:checkpoints/
└── color_object/
└── step_30000/
├── config.json
└── diffusion_pytorch_model.safetensors1WEIGHT=/path/to/checkpoints/color_object/step_30000 \
2LTX_MODEL=/path/to/LTX-Video \
3conda run -n genie_envisioner \
4 bash genie_envisioner/run_ood_experiment_inference.sh \
5 color_object \
6 42 \
7 200 \
8 results/color_object_ood.txt| Experiment | Factor A | Factor B | Description |
|---|---|---|---|
color_object | color | shape | Red object vs. cube — which does the model lift? |
color_size | color | size | Coloured vs. sized object |
color_spatial | color | spatial position | Coloured vs. positioned object |
size_object | size | shape | Sized vs. shaped object |
spatial_object | spatial position | shape | Positioned vs. shaped object |
spatial_size | spatial position | size | Positioned vs. sized object |
verb_color | verb | color | Verb-defined vs. coloured target |
verb_object | verb | shape | Verb-defined vs. shaped target |
verb_size | verb | size | Verb-defined vs. sized target |
verb_spatial | verb | spatial position | Verb-defined vs. positioned target |
FDR(f1, f2) = (S_f1 - S_f2) / (S_f1 + S_f2 + ε) ∈ [-1, +1]mani_skill/envs/tasks/) is a modified version of ManiSkill's
tabletop manipulation task. Key properties:agent/qpos, agent/qvel — proprioceptive joint statesensor_data/base_camera/rgb — 256×256 RGB camera imagesensor_data/base_camera/depth — depth image1WEIGHT_ROOT=/path/to/checkpoints
2LTX_MODEL=/path/to/LTX-Video
3
4for EXP in color_object color_size color_spatial size_object spatial_object \
5 spatial_size verb_color verb_object verb_size verb_spatial; do
6 WEIGHT="${WEIGHT_ROOT}/${EXP}/step_30000" \
7 LTX_MODEL="${LTX_MODEL}" \
8 conda run -n genie_envisioner \
9 bash genie_envisioner/run_ood_experiment_inference.sh \
10 "${EXP}" 42 200 "results/genie_${EXP}_seed42.txt"
11donegenie_envisioner/eval_conflict.md for:torch==2.6.0+cu124diffusers==0.32.0transformers==4.51.3safetensors==0.6.2mani_skill (from maniskill_conflict/ in this repo)1@inproceedings{genie_envisioner,
2 title = {Genie-Envisioner: ...},
3 author = {...},
4 booktitle = {...},
5 year = {2025},
6}