Este modelo foi treinado com o algoritmo Proximal Policy Optimization (PPO) para controlar uma nave no ambiente LunarLander-v3, utilizando técnicas de aprendizado por reforço com currículo adaptativo, penalidades e variações de dificuldade. O objetivo foi alcançar máxima performance com estabilidade e generalização, atingindo uma pontuação recorde de 322 pontos.
-
Seed adaptativa para melhorar a generalização.
-
Penalidade por passo para aumentar a eficiência.
-
Instabilidade física crescente para simular pousos mais desafiadores.
-
Desenvolvido por: Raul Campos Nascimento
-
Compartilhado por: rautopia
-
Tipo de modelo: Agente de Aprendizado por Reforço (PPO)
-
Idioma: Não se aplica (ambiente de simulação)
-
Licença: MIT
-
Baseado em: PPO da biblioteca Stable-Baselines3
1from stable_baselines3 import PPO
2import gymnasium as gym
3
4modelo = PPO.load("ppo_lunar_adaptativo.zip")
5ambiente = gym.make("LunarLander-v3", render_mode="human")
6
7obs, _ = ambiente.reset()
8terminado = False
9while not terminado:
10 acao, _ = modelo.predict(obs)
11 obs, recompensa, terminado, truncado, _ = ambiente.step(acao)
12 ambiente.render()
Campos Nascimento, R. (2025).
PPO LunarLander-v3 com Currículo Adaptativo. Hugging Face.
https://huggingface.co/rautopia/ppo-lunar-lander-v3-max322