PoEM : prédire les résultats de l'RL à partir de politiques existantes
Une nouvelle méthode permet d'estimer le résultat d'un post-entraînement RL sans relancer l'entraînement, en combinant les politiques de modèles déjà optimisés.
arXiv cs.AI · cs.LG · cs.CL·Kimia Hamidieh, Giannis Daras, Antonio Torralba·24 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche préliminaire (validation synthétique et limitée), sans indépendance ni adoption vérifiée à ce stade.
Pourquoi ce titre est à nuancer
Le titre FR dit 'résultats de l'RL' (anglicisme incompris), mais le corps parle de prédire la politique résultante, pas 'l'RL' lui-même.

Image · Source originale
Le post-entraînement des modèles de fondation par RL est coûteux et instable, nécessitant un reclcul complet à chaque changement de fonction de récompense. PoEM propose de prédire la politique résultante d'une nouvelle récompense en combinant les log-policies de modèles déjà post-entraînés. Les auteurs montrent que ces log-policies occupent un sous-espace de rang faible, permettant d'approximer la nouvelle politique sans entraînement RL supplémentaire. L'approche est validée sur des récompenses synthétiques et réelles, en modalités texte et image.