RECHERCHE
Quand l'optimiseur Muon améliore-t-il l'apprentissage par renforcement agentique ?
Une étude exploratoire compare Muon à AdamW en post-training RL sur des tâches agentiques à récompense éparse, avec des gains significatifs sous certaines conditions.
arXiv cs.AI · cs.LG · cs.CL·Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou·17 juillet 2026

Image · Source originale
Des chercheurs testent l'optimiseur Muon face à AdamW dans un cadre de RL agentique à récompense éparse, sur ALFWorld avec Qwen2.5-0.5B-Instruct. Appliqué aux matrices de poids cachées sous GiGPO, Muon fait passer le taux de succès de 0,290 à 0,546. Les résultats varient selon l'estimateur d'avantage et le taux d'apprentissage utilisés, avec des gains notables sous GraphGPO à faible learning rate. Les auteurs soulignent que la validation multi-seed et inter-tâches reste à effectuer.