Views
No views yet
1# necessary libraries
2import gymnasium as gym
3
4from huggingface_sb3 import load_from_hub, package_to_hub
5from huggingface_hub import (
6 notebook_login,
7)
8
9from stable_baselines3 import PPO
10from stable_baselines3.common.env_util import make_vec_env
11from stable_baselines3.common.evaluation import evaluate_policy
12from stable_baselines3.common.monitor import Monitor
13
14# Step 1 : Create an environment
15env = gym.make("LunarLander-v2")
16observation,info = env.reset() # initialize the environment
17
18# Step 2 : Create the model
19model = PPO(
20 policy = "MlpPolicy", # Multiple Layer Perceptron Policy
21 env = env,
22 n_steps = 1024,
23 batch_size = 64,
24 n_epochs = 5,
25 gamma = 0.995,
26 gae_lambda = 0.98,
27 ent_coef = 0.0001,
28 clip_range = 0.1,
29 verbose = 1
30)
31
32# Step 3 : Train the model
33model.learn(total_timesteps=2500000,progress_bar = True)
34
35# Step 4 : Evaluation
36eval_env = Monitor(gym.make("LunarLander-v2"))
37mean_reward,std_reward = evaluate_policy(model,eval_env,n_eval_episodes = 10 ,deterministic=True)
38print(f"Mean reward : {mean_reward} +/- {std_reward}")