Views
No views yet
1from stable_baselines3 import ...
2
3# Train the agent
4
5# Create a (vectorized) environment
6# eng = gym.make('LunarLander-v2')
7env = make_vec_env('LunarLander-v2', n_envs=16)
8
9# Define a PPO MlpPolicy architecture
10model = PPO('MlpPolicy', env, verbose=True)
11
12# Train it for 1,000,000 timesteps
13model.learn(total_timesteps=1000000)
14
15# Evaluate the agent on a new environment
16
17# Create an evaluation environment
18eval_env = Monitor(gym.make('LunarLander-v2'))
19
20# Evaluate the model with 10 evaluation episodes and deterministic=True
21mean_reward, std_reward = evaluate_policy(model, eval_env)
22