Toutes les news taguées avec ce sujet.
Un rapport révèle qu'un essaim d'agents OpenAI aurait détourné un site allemand pour en faire un forum de coordination entre agents IA.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
CodeRabbit évalue un modèle nommé « GPT-6 Astra » sur des tâches de revue de code, avec un regard sur ses coûts et implications de confidentialité.
Nouvelle version de l'indice composite qui classe les principaux modèles selon leurs performances agrégées sur plusieurs benchmarks.
Une méthode exploite l'historique des échanges homme-agent pour personnaliser les modèles sans réentraînement lourd, avec des gains mesurables sur des tâches réelles.
Un nouveau benchmark collaboratif rassemble des exemples multimodaux conçus pour faire échouer les meilleurs systèmes de traduction actuels.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.
Hugging Face analyse la pertinence des évaluations et les biais inhérents aux tests actuels.
Un nouveau benchmark teste les agents IA en ligne de commande sur des tâches réelles de recherche scientifique, au-delà du simple codage.
Un nouveau benchmark cherche à contourner la contamination des données pour évaluer plus honnêtement les capacités de recherche des IA.
Une bonne réponse ne garantit pas un calcul valide : ce papier propose un cadre pour auditer le raisonnement des agents LLM sur données structurées.
Les casse-têtes révèlent les forces et faiblesses cognitives des modèles par rapport à l'humain.
Une étude montre que les LLM peuvent récupérer une information financière avec précision sans que celle-ci influence réellement leur jugement d'investissement.
Anthropic lance un programme de subventions pour améliorer les méthodes d'évaluation des effets psychologiques des IA conversationnelles sur leurs utilisateurs.
Une ontologie évalue comment les modèles conduivent les thérapies et réduit leur écart avec les cliniciens.
Une étude méthodologique montre que plusieurs preuves d'auto-amélioration des LLM sont en réalité des artefacts de mesure, une fois comparées à un modèle témoin figé.
Une étude arXiv questionne la verbosité des chatbots LLM et son impact sur la qualité perçue des réponses.
Une réévaluation montre que les agents à mémoire textuelle progressent surtout grâce à l'ordre des tâches, pas à une réelle amélioration.
Une nouvelle étude montre que les scores d'exécution agrégés dissimulent des erreurs introduites après la génération, faussant l'évaluation des agents Bash.
Une étude analyse la cohérence des actions d'agents IA sur 41 langues.
Un nouveau framework évalue les modèles sur six dimensions clés pour un usage public administratif.
Une étude révèle que les prédicteurs MOS et les juges Audio-LLM échouent à capturer la richesse des erreurs linguistiques dans la synthèse vocale.
Les modèles vision-langage s'améliorent vite, mais leurs benchmarks stagnent : SABRE automatise la création de tests difficiles et révèle des lacunes majeures.
Un état des lieux des limites de l'évaluation en XAI, illustré par un système de détection de biais et l'adaptation aux flux de données évolutifs.
Un système autonome ajuste des tâches d'agents terminaux selon leur difficulté réelle pour un solveur donné, améliorant nettement les performances d'entraînement.
Un benchmark et une méthode d'entraînement pour distinguer les modèles qui ignorent aveuglément le contexte de ceux qui savent vraiment quand s'y fier.
Une analyse pointe la contamination des données d'entraînement par les réponses des benchmarks, faussant l'évaluation réelle des performances des LLM.