Views
No views yet
apple_S2_tactile_regularized_residual_full_vision_300_best_step3000:当前主模型 S2V,
普通 300 条数据、共享指尖 MLP、state-token 残差触觉、完整 SigLIP 视觉编码器参与训练。config.json 判断;触觉融合、视觉训练范围、数据来源、
SHA256 和闭环结果以代码仓库的 configs/artifacts.json 为准。1git clone git@github.com:SCUT-Turing/SmolVLA_Dexhand_tactile.git
2cd SmolVLA_Dexhand_tactile
3uv sync --locked --python 3.10
4./.venv/bin/python scripts/download_hf_artifacts.py \
5 --model-id apple_S2_tactile_regularized_residual_full_vision_300_best_step3000
6HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 ./run infer S2V --scene-index 9 --viewermain 后续变化破坏复现。S2V 在同一份 30 场景开发集上的 17/30;这些场景已经参与 checkpoint
筛选,不能视为无偏最终测试。项目尚未验证真机下发,权重仅用于研究与 MuJoCo 验证。HuggingFaceTB/SmolVLM2-500M-Video-Instruct。使用时还需遵守
上游模型、代码与资产各自的许可条件。