Toutes les news taguées avec ce sujet.
OpenAI publie une solution générée par IA à l'un des sept problèmes du millénaire, avec preuve formelle en Lean.
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
Les LLM ne se limitent pas à la prédiction statistique du mot suivant.
Un framework de raisonnement structuré vise à réduire les hallucinations des LLM appliqués au diagnostic de pannes réseau 5G/6G.
Le chercheur en informatique quantique revient sur la capacité des grands modèles de langage à raisonner sur eux-mêmes.
Un développeur détaille comment atteindre 44 % de score sur le benchmark ARC-AGI-1 avec un budget de calcul dérisoire.
Un nouveau cadre exploite les échecs typiques des petits LLM comme exemples critiques en contexte, pour améliorer le raisonnement à moindre coût.
Une méthode de distillation corrige le désaccord entre teacher et vérificateur pour améliorer le raisonnement sur des contextes longs.
Une méthode combine correction de raisonnement et détection d'incertitude en un seul passage forward, sans double calcul ni ré-entraînement du modèle.
Un essai avance que les performances des LLM en mathématiques reflètent surtout une capacité de récupération massive plutôt qu'un véritable raisonnement original.
IBM Research publie un benchmark de plus de 8 000 APIs exécutables pour tester les agents LLM sur des scénarios d'entreprise réalistes.
Le mathématicien Timothy Gowers explore les forces et limites des LLM face à différents types de raisonnement mathématique.
Un nouveau rapport de recherche examine comment Claude aborde des problèmes mathématiques complexes, avec un focus sur la fonction zêta de Riemann.
Une nouvelle politique de routage arbitre entre génération, vérification et arrêt pour réduire fortement le coût du raisonnement à l'inférence sans perte de précision.
L'architecture actuelle des LLMs atteint ses limites. Plusieurs acteurs proposent des approches radicales pour réduire les coûts et améliorer le raisonnement.
Après le succès d'AlphaFold, un essai appelle à dépasser le paradigme data-driven pour bâtir une IA scientifique capable de raisonner.
Un essai interroge la confiance excessive de DeepMind dans les capacités de raisonnement visuel des modèles d'IA.
Un système multi-rôles (Manager, Planner, Engineer, Reviewer) qui persiste ou pivote selon les preuves, avec état projet durable et vérification.
Des modèles d'IA aident désormais à résoudre des conjectures mathématiques restées ouvertes depuis des décennies, posées par le légendaire Paul Erdős.