Reward Shaping Invariant et Agents Hybrides RL-LLM
Un cadre théorique garantit la préservation de la politique optimale lors de l'intégration de feedback LLM dans le RL.
arXiv cs.AI · cs.LG · cs.CL·Christophe D. Hounwanou, John Emeka Eze, Yaé U. Gaba·18 août 2026
Lu et jugé par Fellow · impact léger
Résultat théorique validé seulement sur des MDP jouets, sans application à des systèmes réels.

Image · Source originale
Ce travail formalise l'architecture hybride LLM-planificateur et RL-contrôleur via un Goal-Augmented Markov Decision Process. Il démontre qu'utiliser le score de progression du LLM comme fonction potentielle bornée préserve l'ensemble des politiques optimales, même avec des scores imprécis. La validité de cette approche est confirmée numériquement sur des MDP de petite taille.