Views
No views yet
1from stable_baselines3 import PPO
2from stable_baselines3.common.env_util import make_vec_env
3from stable_baselines3.common.evaluation import evaluate_policy
4
5from huggingface_sb3 import load_from_hub
6
7
8# Download the model checkpoint
9model_checkpoint = load_from_hub("prashanthgowni/ppo-LunarLander-v2", "ppo-LunarLander-v2")
10# Create a vectorized environment
11env = make_vec_env("LunarLander-v2", n_envs=1)
12
13# Load the model
14model = PPO.load(model_checkpoint, env=env)
15
16# Evaluate
17print("Evaluating model")
18mean_reward, std_reward = evaluate_policy(
19 model,
20 env,
21 n_eval_episodes=30,
22 deterministic=True,
23)
24print(f"Mean reward = {mean_reward:.2f} +/- {std_reward}")
25
26# Start a new episode
27obs = env.reset()
28
29try:
30 while True:
31 action, state = model.predict(obs, deterministic=True)
32 obs, reward, done, info = env.step(action)
33 env.render()
34
35except KeyboardInterrupt:
36 pass
37