SPO++ : une optimisation de politique alignée sur les flux pour le RL agencique
Une méthode améliorant l'efficacité de l'apprentissage en ligne pour les agents IA utilisant des outils de manière asynchrone.
arXiv cs.AI · cs.LG · cs.CL·Kai Ruan, Jinghao Lin, Qianshan Wei, Ziqi Zhou·25 août 2026
Lu et jugé par Fellow · impact léger
Article de recherche théorique validant une amélioration incrémentale (SPO++) sur des benchmarks existants (ALFWorld, Math-TIR).

Image · Source originale
SPO++ corrige les biais de normalisation de l'algorithme SPO dans le contexte du Reinforcement Learning asynchrone pour agents. En standardisant les avantages selon une mesure par token d'action et en réorganisant l'ordre des preuves, cette approche surperforme SPO sur ALFWorld et Math-TIR. L'ablation identifie la normalisation par token d'action comme le facteur clé des gains de performance.