← Tous les projets
IA & machine learning · 2026

startrek

Deep Q-Network écrit de zéro qui apprend à atterrir dans LunarLander (Gymnasium), avec configs YAML, baselines et expériences multi-seeds. Atteint un retour moyen d'environ 240.

PythonPyTorchGymnasiumNumPyMatplotlib
Équipe
2 personnes
Cadre
Projet Epitech, 2e année
Statut
Terminé
1 / 2Politique aléatoire vs DQN entraîné sur LunarLander

Contexte

LunarLander est considéré comme résolu à partir d'un retour moyen de 200. L'objectif était d'y arriver avec un DQN écrit de zéro et de prouver que le résultat tient sur plusieurs seeds.

Réalisations

  • Implémentation d'un DQN écrite de zéro en PyTorch
  • Configs YAML pour des expériences reproductibles
  • Baselines et exécutions multi-seeds pour comparer honnêtement
  • Courbes d'apprentissage tracées avec Matplotlib

Résultats

239.6retour moyen en évaluation, DQN optimisé sur 5 seeds (résolu à 200)
177.3même DQN avant optimisation
5seeds par expérience, 100 épisodes d'évaluation chacune