FERPO : une optimisation de politique par entropie régularisée sans gradient d'action
Un nouvel algorithme de RL en ligne améliore les politiques via un critique sans différencier celui-ci par rapport aux actions, pour des mises à jour plus fiables.
arXiv cs.AI · cs.LG · cs.CL·Sebastian Sanokowski, Alireza Sarmadi, Majid Khadiv·1 octobre 2026

Image · Source originale
FERPO propose une méthode d'apprentissage par renforcement à entropie maximale qui évite de différencier le critique par rapport aux actions, contrairement aux approches classiques basées sur le gradient d'action. L'acteur est ajusté via un objectif forward-KL estimé par importance sampling auto-normalisé, favorisant la couverture de plusieurs modes à haute valeur et l'exploration. Les expériences sur MuJoCo Playground et ManiSkill montrent des gains de performance et d'efficacité d'échantillonnage, avec des mises à jour plus rapides que des méthodes concurrentes.