Views
No views yet
Pusher-v5Pusher-v5 환경에서 학습된 Stable-Baselines3 PPO (Proximal Policy Optimization) 강화학습 로봇 팔 제어 정책 모델입니다.Pusher-v5 (MuJoCo 7-DoF Robotic Arm)-39.05 (총 100,000 타임스텝 학습)1import gymnasium as gym
2from stable_baselines3 import PPO
3from huggingface_hub import hf_hub_download
4
5# 1. 허깅페이스에서 모델 다운로드
6model_path = hf_hub_download(repo_id="leegoheun/ppo-pusher-v5", filename="ppo_pusher.zip")
7
8# 2. 환경 생성 및 모델 로드
9env = gym.make("Pusher-v5", render_mode="human")
10model = PPO.load(model_path, env=env)
11
12# 3. 로봇 팔 제어 실행
13obs, info = env.reset()
14for _ in range(1000):
15 action, _states = model.predict(obs, deterministic=True)
16 obs, reward, terminated, truncated, info = env.step(action)
17 if terminated or truncated:
18 obs, info = env.reset()
19
20env.close()1Algorithm: PPO
2Policy: MlpPolicy (23 -> 64 -> 64 -> 7)
3Learning Rate: 3e-4
4Timesteps: 100000
5Batch Size: 64
6n_steps: 2048
7Gamma: 0.99
8GAE Lambda: 0.95
9Clip Range: 0.2