Views
No views yet
1from huggingface_sb3 import load_from_hub
2from stable_baselines3 import PPO
3from stable_baselines3.common.env_util import make_vec_env
4from stable_baselines3.common.evaluation import evaluate_policy
5
6checkpoint = load_from_hub("jkkawach/ppo-LunarLander-v2", "ppo-LunarLander-v2.zip")
7model = PPO.load(checkpoint)
8
9env = make_vec_env("LunarLander-v2", n_envs=1)
10
11print("Evaluating model")
12mean_reward, std_reward = evaluate_policy(
13 model,
14 env,
15 n_eval_episodes=20,
16 deterministic=True,
17)
18print(f"Mean reward = {mean_reward:.2f} +/- {std_reward:.2f}")
19
20obs = env.reset()
21
22try:
23 while True:
24 action, _states = model.predict(obs, deterministic=True)
25 obs, rewards, dones, info = env.step(action)
26 env.render()
27except KeyboardInterrupt:
28 pass
29