Views
No views yet
1model = PPO(
2 policy = 'MlpPolicy',
3 env = env,
4 n_steps = 1024,
5 batch_size = 64,
6 n_epochs = 10,
7 gamma = 0.999,
8 gae_lambda = 0.98,
9 ent_coef = 0.01,
10 verbose=1)
111steps = 1e6
2model.learn(total_timesteps=int(steps))1from stable_baselines3 import ...
2from huggingface_sb3 import load_from_hub
3
4...