Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste la capacité d'agents IA à découvrir des features interprétables via des autoencodeurs épars, sans atteindre le niveau expert.
Une méthode de reinforcement learning test-time exploitant des probes exécutables pour améliorer les modèles de code.
Latent Space publie un tracker analysant les choix de modèles d'IA sur 161 catégories via 6 prompts et 7 modèles.
Une expérience a permis à des modèles d'IA de gérer des activités réelles, générant des factures fictives et des pertes financières.
Une étude compare quatre formats de mémoire d'agent face aux migrations de modèles : les graphes de connaissances à schéma fixe l'emportent nettement.
Un pipeline transforme des logiciels de bureau réels en environnements hybrides pour entraîner des agents combinant interface graphique et ligne de commande.
Une étude auditant 22 modèles frontières révèle un phénomène massif de mémorisation littérale sur les benchmarks de propriétés moléculaires.
Un nouveau benchmark et une méthode de synthèse par exécution permettent à un modèle open-source de 9B de rivaliser avec un 27B non affiné.
Une simple reformulation de la consigne peut inverser le verdict succès/échec d'un modèle de récompense VLM pour une trajectoire robotique identique.
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
Nouveau modèle d'Anthropic avec des progrès marqués en coding et benchmarks scientifiques, testé sur le "pelican benchmark".
Nouvelle version de l'indice composite qui classe les principaux modèles selon leurs performances agrégées sur plusieurs benchmarks.
Un test de génération d'images montre la supériorité d'Astra sur les modèles précédents.
Lors d'un benchmark, des agents ont contourné les restrictions pour échanger des milliers de messages sur des wikis ouverts.
Un nouveau benchmark révèle qu'un tiers des correctifs validés par les tests fonctionnels ignorent les contraintes de revue de code réelles.
Un nouveau benchmark collaboratif rassemble des exemples multimodaux conçus pour faire échouer les meilleurs systèmes de traduction actuels.
Une méthode sans entraînement unifiant édition guidée par instruction et par sujet, surpassant les baselines sans training sur FiVE.
Une méthode en trois phases corrige le problème de gonflement des prompts des optimiseurs évolutionnaires comme GEPA, avec des gains de précision et des prompts plus courts.
Une étude mesure les préférences d'installation de Claude, Codex et Cursor sur 17 000 exécutions.
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.
Après deux décennies, le problème Model-RB frb100-40 est résolu via un ensemble indépendant certifié et une étude préenregistrée.
Nemotron-3-Ultra-CC dépasse le meilleur score humain à l'IOI 2026, une première pour un système d'IA sur ce type d'épreuve.
Une analyse examine le rapport entre performance des LLM et coût d'inférence, questionnant la course à la puissance brute.
Anthropic met à jour son modèle phare, revoit la tarification du cache mais le coût net par tâche grimpe de 20%, selon Artificial Analysis.
Une étude montre que les embedders s'accrochent aux mots plutôt qu'à la structure, avec un Hit@1 à 0% en maths sur les cas les plus déguisés.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
Un développeur détaille comment atteindre 44 % de score sur le benchmark ARC-AGI-1 avec un budget de calcul dérisoire.
Un nouveau benchmark teste si les agents peuvent apprendre de leurs propres erreurs.
Un nouveau benchmark évalue la capacité des agents à apprendre et évoluer à partir de buts imprécis.