Views
No views yet
1# 1 - 2
2env_id = "PandaPickAndPlace-v3"
3
4env = gym.make(env_id)
5
6# 4
7from stable_baselines3 import HerReplayBuffer, SAC
8model = TQC(policy = "MultiInputPolicy",
9 env = env,
10 batch_size=2048,
11 gamma=0.95,
12 learning_rate=1e-4,
13 train_freq=64,
14 gradient_steps=64,
15 tau=0.05,
16 replay_buffer_class=HerReplayBuffer,
17 replay_buffer_kwargs=dict(
18 n_sampled_goal=4,
19 goal_selection_strategy="future",
20 ),
21 policy_kwargs=dict(
22 net_arch=[512, 512, 512],
23 n_critics=2,
24 ),
25 tensorboard_log=f"runs/{wandb_run.id}",
26 )
27
28# 5
29model.learn(1_000_000, progress_bar=True, callback=WandbCallback(verbose=2))
30wandb_run.finish()