Un écart d'optimalité en O(1/N) pour les MDP faiblement couplés à récompense moyenne
Des chercheurs proposent une nouvelle politique qui dépasse la borne classique en 1/√N pour une famille de processus de décision markoviens couplés.
arXiv cs.AI · cs.LG · cs.CL·Yige Hong, Xiangcheng Zhang, Qiaomin Xie, Yudong Chen·29 septembre 2026

Image · Source originale
L'étude porte sur les MDP faiblement couplés (WCMDP) à récompense moyenne, composés de N sous-MDP identiques partageant des contraintes de budget. Les auteurs identifient des conditions permettant de dépasser l'écart d'optimalité classique en O(1/√N) et conçoivent une politique atteignant O(1/N). Contrairement aux approches précédentes basées sur des ordres de priorité, cette politique induit une dynamique de champ moyen localement linéaire.