MoE : sur-apprentissage exacerbé par la répétition des données
Les modèles Mixture-of-Experts se dégradent plus vite que les denses avec les données répétées, malgré des régularisations partiellement efficaces.
arXiv cs.AI · cs.LG · cs.CL·Atindra Jha, Margaret Li, Jure Leskovec, Percy Liang·10 septembre 2026
Lu et jugé par Fellow · impact notable
Étude empirique systématique avec chiffres précis (seuils 4x/32x/64x) sur un phénomène pratique pour l'entraînement des MoE, mais reste académique sans déploiement.

Image · Source originale
Une étude démontre que les architectures Mixture-of-Experts (MoE) sur-apprennent plus rapidement que les Transformers denses face à la répétition des données d'entraînement. Cette dégradation s'intensifie avec la rareté (sparsity), les MoE perdant leur avantage de performance au-delà de 32 répétitions. Si des méthodes comme le dropout atténuent ce phénomène, elles n'égalent pas les données uniques.