Toutes les news taguées avec ce sujet.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Des chercheurs analysent comment des agents IA développent des conventions sociales uniquement par mimétisme.
Un framework agentif vérifie la logique des preuves pour réduire les attributions erronées dans les citations académiques.
Un chercheur du MIT utilise GPT-5.6 Sol et Codex pour piloter, analyser et calibrer des expériences quantiques.
Un post Reddit affirme que l'agent Codex, alimenté par un mystérieux modèle « GPT-6 Astra Low », a réussi à lancer une fusée dans le jeu Factorio.
Danijar Hafner mise sur les world models et le reinforcement learning pour permettre à des robots humanoïdes de s'adapter à des environnements inconnus.
Analyse empirique de la capacité des agents IA à appliquer correctement les méthodes de vérification et de tests logiciels.
Latent Space publie un tracker analysant les choix de modèles d'IA sur 161 catégories via 6 prompts et 7 modèles.
Une expérience a permis à des modèles d'IA de gérer des activités réelles, générant des factures fictives et des pertes financières.
Une étude compare quatre formats de mémoire d'agent face aux migrations de modèles : les graphes de connaissances à schéma fixe l'emportent nettement.
Un projet open source combine plusieurs moteurs de calcul avec vérification des résultats, exposé via un serveur MCP.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
Exploiter un ancien smartphone comme serveur local pour exécuter des agents IA, réduisant ainsi les coûts et la latence.
OpenAI expose sa méthode pour détecter et corriger les comportements indésirables de ses agents d'IA.
L'agent Grok Bot facilite la connexion aux services web et automatisent les workflows, comparé à OpenClaw.
Lors d'un benchmark, des agents ont contourné les restrictions pour échanger des milliers de messages sur des wikis ouverts.
Une méthode exploite l'historique des échanges homme-agent pour personnaliser les modèles sans réentraînement lourd, avec des gains mesurables sur des tâches réelles.
Un incident inédit de « breakout » d'IA impliquant des agents OpenAI a permis le détournement d'un site web allemand.
L'éditeur de code Zed révèle comment l'approche agentielle résout enfin la promesse de son architecture.
Un fil Hacker News interroge la communauté sur les usages concrets du Model Context Protocol au-delà des démonstrations.
Anthropic dévoile une offre Claude dédiée aux agents IA spécialisés dans le e-commerce et les transactions.
Un nouvel outil open-source pour doter les agents codeurs d'une mémoire durable et contrôlée par l'utilisateur.
Une erreur de l'outil Claude Code a entraîné la suppression irréversible de fichiers liés au patrimoine de Bengaluru.
SAGE interroge un VLM seulement en cas d'incertitude pour distiller une politique RL légère, autonome à l'évaluation.
Un cadre de conception de mécanismes incitant les agents IA à l'honnêteté et l'obéissance malgré des préférences et capacités inconnues.
Une taxonomie unifiée montre comment le feedback en langage naturel façonne les agents IA, du cadrage de tâche à l'entraînement des paramètres.
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
Basis, Clay et Exa Labs utilisent des agents IA pour transformer l'onboarding et la gestion.
NVIDIA propose une architecture agentic pour automatiser la cybersécurité et détecter les menaces inconnues.
Face à l'afflux de pull requests générées par IA, des projets comme Flue et tldraw ferment les PR externes et automatisent la gestion via des agents.