Views
No views yet
1import gym
2
3from huggingface_sb3 import load_from_hub
4
5from stable_baselines3 import PPO
6from stable_baselines3.common.evaluation import evaluate_policy
7from stable_baselines3.common.env_util import make_vec_env
8
9env = make_vec_env('LunarLander-v2', n_envs=16)
10model = PPO('MlpPolicy', env, verbose=1)
11
12model.learn(total_timesteps=5 * 10**5)
13
14eval_env = gym.make('LunarLander-v2')
15mean_reward, std_reward = evaluate_policy(model, env, n_eval_episodes=10, deterministic=True)
16print(f"Reward mean: {mean_reward:.2f}, Reward STD: {std_reward:.2f}")