This is a pre-trained model (TQC agent) for
XArm7PickAndPlace-v3 simulation task, defined in
here.
1OrderedDict([
2 ('batch_size', 2048),
3 ('buffer_size', 1000000),
4 ('ent_coef', 'auto'),
5 ('gamma', 0.95),
6 ('learning_rate', 0.001),
7 ('learning_starts', 100),
8 ('policy', 'MultiInputPolicy'),
9 ('policy_kwargs', dict(net_arch=[512, 512, 512], n_critics=2)),
10 ('replay_buffer_class', HerReplayBuffer),
11 ('replay_buffer_kwargs', dict( goal_selection_strategy='future', n_sampled_goal=4)),
12 ('tau', 0.05)
13])