Toutes les news taguées avec ce sujet.
Une étude formalise une faille des évaluateurs de plans : supprimer des étapes gênantes peut améliorer artificiellement leur score, et propose un mécanisme de blocage.
Une étude explore si les agents d'IA spécialisés en code planifient réellement à l'avance ou se limitent à une exécution séquentielle réactive.
Un algorithme de planification en ligne partage les futurs simulés entre plusieurs décisions candidates, évitant la croissance exponentielle des arbres MCTS.
Un papier arXiv tente de cartographier l'écosystème de l'IA agentique : architectures, patterns, défis et état de l'art.
Un papier arXiv propose de faire du log d'exécution le composant central des agents IA, repensant ainsi leur architecture fondamentale.
Rigorix OSS propose une approche où l'agent traduit d'abord l'intention en graphe acyclique dirigé avant de lancer le moindre appel.
Une nouvelle approche autoregressieve pour sélectionner, ordonner et combiner des compétences modulaires dans les agents LLM, dépassant les limites des méthodes par retrieval.
Des chercheurs proposent AdaJEPA, un world model capable de se recalibrer en temps réel pendant la planification, sans démonstrations expertes supplémentaires.
Un framework qui améliore la clairvoyance des agents LLM sans modifier leurs paramètres, grâce à une mémoire épisodique et sémantique évolutive.
Une méthode d'exploration autonome d'environnements GUI permet à un modèle 7B de surpasser Qwen2.5-VL-32B sur la planification de tâches.
Un cadre théorique pour certifier localement les capacités d'agents IA généraux, là où les garanties uniformes classiques échouent.
L'équipe Qwen présente AgentWorld, un cadre de world models en langage naturel destiné à entraîner et évaluer des agents IA généraux.
Un développeur a laissé un agent IA jouer à Civilization — avec des résultats surprenants, dont la construction de l'arme atomique.