Views
No views yet
1import pybullet_envs
2import panda_gym
3import gym
4
5import os
6
7from huggingface_sb3 import load_from_hub, package_to_hub
8
9from stable_baselines3 import A2C
10from stable_baselines3.common.evaluation import evaluate_policy
11from stable_baselines3.common.vec_env import DummyVecEnv, VecNormalize
12from stable_baselines3.common.env_util import make_vec_env
13
14from huggingface_hub import notebook_login
15
16#Environment 1: AntBulletEnv-v0
17env_id = "AntBulletEnv-v0"
18# Create the env
19env = gym.make(env_id)
20
21env = make_vec_env(env_id, n_envs=4)
22
23# Adding this wrapper to normalize the observation and the reward
24env = VecNormalize(env, norm_obs=True, norm_reward=True, clip_obs=10)
25
26#create A2C model
27model = A2C(policy = "MlpPolicy",
28 env = env,
29 gae_lambda = 0.9,
30 gamma = 0.99,
31 learning_rate = 0.00096,
32 max_grad_norm = 0.5,
33 n_steps = 8,
34 vf_coef = 0.4,
35 ent_coef = 0.0,
36 seed=11,
37 policy_kwargs=dict(
38 log_std_init=-2, ortho_init=False),
39 normalize_advantage=False,
40 use_rms_prop= True,
41 use_sde= True,
42 verbose=1)
43
44#train agent
45model.learn(1_500_000)
46
47# Save the model and VecNormalize statistics when saving the agent
48model.save("a2c-AntBulletEnv-v0")
49env.save("vec_normalize.pkl")