Views
No views yet
PI05Policy チェックポイントとしてそのままロードできる。lerobot/pi05_libero_finetuned_v044) for robustness to background-texture and lighting perturbations in LIBERO-plus manipulation tasks. LoRA weights are merged; load directly with lerobot's PI05Policy.| 項目 | 内容 |
|---|---|
| ベースモデル | lerobot/pi05_libero_finetuned_v044(rev 8e17415) |
| 手法 | LoRA(マージ済み)r=32 / α=32 |
| LoRA 適用先 | 視覚エンコーダ(SigLIP)attention q/v + action expert(Gemma)attention q/v + 状態/行動射影層 |
| 学習データ | lerobot/libero_plus から選別した 500 エピソード |
| 学習 | 3,000 steps / batch 2 / LR 1e-4 → 1e-5(cosine decay、warmup 100)/ seed 42 |
| 入出力 | 入力: agentview + 手首カメラ画像(128×128 推奨)+ ロボット状態 + 言語指示 / 出力: 7 次元 EE デルタ action [dx, dy, dz, droll, dpitch, dyaw, gripper] |
freeze_vision_encoder=false とし、SigLIP の attention にも LoRA を適用した。背景テクスチャ・照明という「知覚側」の摂動に対する頑健性は、この視覚適応が主要因であることを層別の切り分け実験(視覚のみ / 言語塔のみ)で確認している。n_action_steps=10(10 ステップごとに再計画)+ action EMA β=0.3(軌道平滑化、jerk 約 −14%)。画像は学習時と整合する 128×128 で入力する。1from lerobot.configs import PreTrainedConfig
2from lerobot.policies.pi05.modeling_pi05 import PI05Policy
3
4model_id = "Kaito-F/pi05_libero_plus_t1_lora_v15b_btlc_vis"
5cfg = PreTrainedConfig.from_pretrained(model_id)
6cfg.n_action_steps = 10
7policy = PI05Policy.from_pretrained(model_id, config=cfg)
8policy.eval()
9# 観測(画像 2 視点 + 状態 + 指示)を前処理して policy.select_action(...) を呼ぶ。
10# 出力 action 列に EMA(β=0.3)を掛けると軌道が滑らかになる(任意)。policy_preprocessor.json / policy_postprocessor.json)を make_pre_post_processors で適用する。action_time_mlp_*)は実モジュール名(time_mlp_*)と一致せず、当該層は実質未適応(視覚 q/v・expert q/v・射影層は適応済み)。lerobot/libero_plus データセットの各ライセンス・利用条件に従う。π0.5: Physical Intelligence、LIBERO-plus: 原著者ら、学習フレームワーク: lerobot。