Toutes les news taguées avec ce sujet.
Une étude identifie la découverte de primitifs mathématiques comme principal goulot d'étranglement du raisonnement des LLM, et propose une méthode de correction par auto-distillation.
Une nouvelle méthode combine signaux du vérificateur et du modèle enseignant dans GRPO pour affiner l'apprentissage du raisonnement mathématique token par token.
Une étude montre que les LLM performants encodent différemment les réordonnancements de règles, même quand la réponse finale reste identique.