La fonction de perte ne voit pas la base, mais Adam la voit
Une étude théorique explique pourquoi Adam brise le biais implicite vers les solutions de rang faible que la descente de gradient préserve naturellement.
arXiv cs.AI · cs.LG · cs.CL·Devender Singh·5 août 2026

Image · Source originale
Les auteurs montrent que la descente de gradient est implicitement biaisée vers des solutions de rang faible grâce à une symétrie de jauge de la perte, un avantage qu'Adam ne conserve pas car il n'est pas équivariant à cette jauge. Un théorème de structure caractérise les règles de mise à jour équivariantes, et des expériences sur la détection de matrices et les transformers confirment cette anisotropie comme cause du phénomène.