Views
No views yet

1import gymnasium as gym
2from stable_baselines3 import PPO
3from stable_baselines3.common.monitor import Monitor
4from stable_baselines3.common.evaluation import evaluate_policy
5from huggingface_hub import hf_hub_download
6
7# -------------------------
8# Environment Setup
9# -------------------------
10env = gym.make("LunarLander-v2", render_mode="human") # Human render
11eval_env = Monitor(gym.make("LunarLander-v2")) # Evaluation (no render)
12
13# -------------------------
14# Load pretrained model
15# -------------------------
16model_path = hf_hub_download("Vishand03/lunarlander-ppo", "model.zip")
17model = PPO.load(model_path)
18
19# -------------------------
20# Run one episode
21# -------------------------
22obs, _ = env.reset()
23done = False
24while not done:
25 action, _ = model.predict(obs, deterministic=True)
26 obs, reward, terminated, truncated, _ = env.step(action)
27 done = terminated or truncated
28
29# -------------------------
30# Evaluate policy
31# -------------------------
32mean_reward, std_reward = evaluate_policy(model, eval_env, n_eval_episodes=10, deterministic=True)
33print(f"Mean Reward: {mean_reward:.2f} +/- {std_reward:.2f}")