Toutes les news taguées avec ce sujet.
Une analyse théorique fine montre comment l'anisotropie des données redessine les courbes d'apprentissage en grande dimension pour les noyaux polynomiaux.
Une étude montre que les modèles entraînés avec l'optimiseur Muon apprennent plus vite mais perdent leur généralisation après le grokking.