Views
No views yet
1from huggingface_sb3 import load_from_hub
2from stable_baselines3 import DQN
3from stable_baselines3.common.env_util import make_vec_env
4from stable_baselines3.common.evaluation import evaluate_policy
5
6# Download checkpoint
7checkpoint = load_from_hub("araffin/dqn-LunarLander-v2", "dqn-LunarLander-v2.zip")
8# Remove warning
9kwargs = dict(target_update_interval=30)
10# Load the model
11model = DQN.load(checkpoint, **kwargs)
12
13env = make_vec_env("LunarLander-v2", n_envs=1)
14
15# Evaluate
16print("Evaluating model")
17mean_reward, std_reward = evaluate_policy(
18 model,
19 env,
20 n_eval_episodes=20,
21 deterministic=True,
22)
23print(f"Mean reward = {mean_reward:.2f} +/- {std_reward:.2f}")
24
25# Start a new episode
26obs = env.reset()
27
28try:
29 while True:
30 action, _states = model.predict(obs, deterministic=True)
31 obs, rewards, dones, info = env.step(action)
32 env.render()
33except KeyboardInterrupt:
34 pass1from stable_baselines3 import DQN
2from stable_baselines3.common.env_util import make_vec_env
3from stable_baselines3.common.callbacks import EvalCallback
4
5# Create the environment
6env_id = "LunarLander-v2"
7n_envs = 8
8env = make_vec_env(env_id, n_envs=n_envs)
9
10# Create the evaluation envs
11eval_envs = make_vec_env(env_id, n_envs=5)
12
13# Adjust evaluation interval depending on the number of envs
14eval_freq = int(1e5)
15eval_freq = max(eval_freq // n_envs, 1)
16
17# Create evaluation callback to save best model
18# and monitor agent performance
19eval_callback = EvalCallback(
20 eval_envs,
21 best_model_save_path="./logs/",
22 eval_freq=eval_freq,
23 n_eval_episodes=10,
24)
25
26# Instantiate the agent
27# Hyperparameters from https://github.com/DLR-RM/rl-baselines3-zoo
28model = DQN(
29 "MlpPolicy",
30 env,
31 learning_starts=0,
32 batch_size=128,
33 buffer_size=100000,
34 learning_rate=7e-4,
35 target_update_interval=250,
36 train_freq=1,
37 gradient_steps=4,
38 # Explore for 40_000 timesteps
39 exploration_fraction=0.08,
40 exploration_final_eps=0.05,
41 policy_kwargs=dict(net_arch=[256, 256]),
42 verbose=1,
43)
44
45# Train the agent (you can kill it before using ctrl+c)
46try:
47 model.learn(total_timesteps=int(5e5), callback=eval_callback)
48except KeyboardInterrupt:
49 pass
50
51# Load best model
52model = DQN.load("logs/best_model.zip")