Views
No views yet
1...
2model = PPO(policy='MlpPolicy', env = env, verbose = True)
3...
4model.learn(total_timesteps=1000000, progress_bar=True)
5...
6eval_env = Monitor(gym.make("LunarLander-v2"))
7mean_reward, std_reward = evaluate_policy(model, eval_env, n_eval_episodes=10, deterministic=True)
8...