Views
No views yet
1import gymnasium
2
3from huggingface_sb3 import load_from_hub
4
5from stable_baselines3 import PPO
6from stable_baselines3.common.env_util import make_vec_env
7from stable_baselines3.common.evaluation import evaluate_policy
8from stable_baselines3.common.monitor import Monitor
9
10checkpoint = load_from_hub("raymond-andrade/ppo-LunarLander-v2", "ppo-LunarLander-v2.zip")
11model = PPO.load(checkpoint)
12
13env = make_vec_env("LunarLander-v2", n_envs=1)
14
15mean_reward, std_reward = evaluate_policy(
16 model,
17 env,
18 n_eval_episodes=20,
19 deterministic=True,
20)
21
22print(f"Mean reward = {mean_reward:.2f} +/- {std_reward:.2f}")
231
2env = make_vec_env('LunarLander-v2', n_envs=32)
3
4### Or use the following for vectorized envs
5"""
6from stable_baselines3.common.env_util import make_vec_env
7from stable_baselines3.common.vec_env import SubprocVecEnv
8
9env = make_vec_env(
10 "LunarLander-v2",
11 n_envs=32,
12 vec_env_cls=SubprocVecEnv
13)
14"""
15
16model = PPO(
17 "MlpPolicy",
18 env,
19 learning_rate=5e-4,
20 n_steps=1024,
21 batch_size=64,
22 n_epochs=4,
23 gamma=0.995,
24 gae_lambda=0.98,
25 ent_coef=0.01,
26 verbose=1,
27)
28
29model.learn(total_timesteps=3000000)
30
31model.save("your-desired-model-name")
32