Views
No views yet
| Metric | Value |
|---|---|
| Mean Reward | 245.47 |
| Std Reward | 30.51 |
| Eval Episodes | 10 |
| Total Timesteps | 1,000,000 |
1model = PPO(
2 policy="MlpPolicy",
3 env=env,
4 n_steps=1024,
5 batch_size=64,
6 n_epochs=4,
7 gamma=0.999,
8 gae_lambda=0.98,
9 ent_coef=0.01,
10 verbose=1
11)1from stable_baselines3 import PPO
2from huggingface_sb3 import load_from_hub
3
4repo_id = "ITSRAJ09/ppo-LunarLander-v3"
5filename = "ppo-LunarLander-v3.zip"
6
7model = load_from_hub(repo_id, filename)
8
9import gymnasium as gym
10env = gym.make("LunarLander-v3")
11
12obs, _ = env.reset()
13for _ in range(1000):
14 action, _states = model.predict(obs, deterministic=True)
15 obs, reward, terminated, truncated, info = env.step(action)
16 if terminated or truncated:
17 obs, _ = env.reset()