RECHERCHE
Convergence et regret du gradient de politique pour les bandits multi-bras en environnement de diffusion
Une analyse théorique montre la convergence presque sûre du gradient de politique vers le bras optimal, avec un regret borné en O(log T).
arXiv cs.AI · cs.LG · cs.CL·Yanwei Jia, Du Ouyang·31 juillet 2026

Image · Source originale
Cette étude examine la mise à jour par gradient de politique dans un problème de bandit multi-bras modélisé par une équation différentielle stochastique, dans le cadre du reinforcement learning en temps continu. Avec une paramétrisation logit de la politique stochastique, les auteurs démontrent une convergence presque sûre vers le bras optimal pour tout taux d'apprentissage constant, ainsi qu'une borne de regret non asymptotique en O(log T) sous certaines conditions. Une nouvelle fonction de Lyapunov permet d'affiner les analyses précédentes et s'applique également au cas discret.