Toutes les news taguées avec ce sujet.
Les revendications d'OpenAI sur une avancée majeure en raisonnement mathématique sont contestées par la communauté scientifique.
L'approche probabiliste jugée risquée par les spécialistes de la sécurité de l'IA.
Une nouvelle méthode RLVR identifie la première erreur de raisonnement pour guider l'entraînement des LLM.
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
Une méthode perturbe les trajectoires via des modèles plus faibles pour préserver la diversité et la couverture du raisonnement.
Une méthode d'apprentissage sans étiquettes qui combine distillation et RL pour améliorer le raisonnement mathématique.
Une méthode de post-training transforme des VLMs standards en raisonneurs robotiques capables de guider des politiques de manipulation complexes.
Une technique qui tronque la mémoire des LLM pendant le raisonnement long, sans perte de performance, pour un scaling moins coûteux.
Le nouveau modèle vision d'Alibaba impressionne sur les benchmarks, mais son mode de raisonnement par défaut génère un surcoût de calcul énorme.
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
Un modèle LLM apprend à sélectionner le niveau de raisonnement nécessaire par problème, réduisant le coût de calcul de 41%.
Un benchmark basé sur l'Olympiade Internationale de Linguistique pour tester la capacité des modèles à déduire des règles.
Une nouvelle approche pour le raisonnement géométrique.
Le mathématicien Timothy Gowers explore les forces et limites des LLM face à différents types de raisonnement mathématique.
Un nouveau modèle de raisonnement combine apprentissage in-context et mémoire récurrente, battant le record d'efficacité coût/précision sur ARC-AGI-1.
Une étude analyse les compromis entre mode « réflexion » et mode concis lors de l'entraînement conjoint de LLM sur des problèmes mathématiques.
Une nouvelle méthode corrige les limites des approches par confiance pour le raisonnement des LLM.
Une nouvelle méthode déplace la phase de "thinking" dans l'espace latent pour optimiser les performances.
Une méthode de self-distillation on-policy qui se concentre sur les pivots de raisonnement pour améliorer le transfert de compétences multilingue des LLM.
Une méthode d'infrastructure découpe le raisonnement long en étapes indépendantes pour limiter la propagation d'erreurs.
Un nouveau benchmark et une méthode RL mesurent et améliorent la capacité des LLM à basculer entre compétences dans des chaînes de raisonnement complexes.
Une collection de 50 générateurs pour l'entraînement supervisé par complétion, améliorant les performances sur DROP et ARC-Challenge.