Exploration de l'espace des experts en RL MoE
ESRL est un nouveau cadre qui optimise l'exploration des modèles MoE via le routage stochastique.
arXiv cs.AI · cs.LG · cs.CL·Hongyi He, Zhenghao Lin, Xiao Liu, Peng Cheng·11 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale de RL pour MoE avec gains mesurés (+3.2/+4.5 pts), mais méthode spécifique sans validation indépendante étendue.

Image · Source originale
Ce papier introduit ESRL, un framework pour l'apprentissage par renforcement sur les modèles Mixture-of-Experts (MoE). En perturbant sélectivement le routage des experts tout en préservant les chemins à haute confiance, ESRL améliore la diversité des rollouts et la performance sur diverses architectures de routage.