startrek
Deep Q-Network écrit de zéro qui apprend à atterrir dans LunarLander (Gymnasium), avec configs YAML, baselines et expériences multi-seeds. Atteint un retour moyen d'environ 240.
Équipe
2 personnes
Cadre
Projet Epitech, 2e année
Statut
Terminé
Contexte
LunarLander est considéré comme résolu à partir d'un retour moyen de 200. L'objectif était d'y arriver avec un DQN écrit de zéro et de prouver que le résultat tient sur plusieurs seeds.
Réalisations
- Implémentation d'un DQN écrite de zéro en PyTorch
- Configs YAML pour des expériences reproductibles
- Baselines et exécutions multi-seeds pour comparer honnêtement
- Courbes d'apprentissage tracées avec Matplotlib
Résultats
239.6retour moyen en évaluation, DQN optimisé sur 5 seeds (résolu à 200)
177.3même DQN avant optimisation
5seeds par expérience, 100 épisodes d'évaluation chacune
