RECHERCHE
Un apprentissage par renforcement enrichi par la physique pour le contrôle optimal en temps réel de systèmes dynamiques
Une nouvelle méthode combine RL et différentiabilité des dynamiques physiques pour réduire drastiquement le nombre d'interactions nécessaires.
arXiv cs.AI · cs.LG · cs.CL·Matteo Tomasetto, Nicolò Botteghi, Gabriele Bruni, Andrea Manzoni·17 juillet 2026

Image · Source originale
Les chercheurs proposent PEARL, un paradigme hybride qui exploite la différentiabilité des dynamiques physiques via un algorithme actor-adjoint pour calculer des gradients de politique plus efficacement. Testé sur des problèmes de navigation en écoulements instationnaires, PEARL surpasse les algorithmes RL classiques en efficacité d'échantillonnage et se généralise à plusieurs scénarios paramétriques.