Agent-Editing World Model : repenser la modélisation du monde pour les agents LLM
Un nouveau modèle du monde corrige les raisonnements bruités des agents LLM plutôt que de simuler les retours des outils.
arXiv cs.AI · cs.LG · cs.CL·Shuang Sun, Guoxin Chen, Fanzhe Meng, Jia Deng·23 septembre 2026
Lu et jugé par Fellow · impact notable
Résultats vérifiables sur 6 benchmarks avec 3 architectures d'agents, apportant un gain de 3,2 à 6,7 points sur des tâches longues.

Image · Source originale
AEWM propose de modéliser l'impact du raisonnement et des actions sur la progression des tâches, plutôt que de reconstruire les réponses des outils. Il combine un module de jugement des actions (critiques, exploratoires, bruitées) et une révision d'état pour corriger les enchaînements de raisonnement défaillants. Entraîné sur les domaines Search, Terminal et Software Engineering, il atteint 70,5% de macro-F1 sur son benchmark et améliore les performances de 3,2 à 6,7 points sur six benchmarks avec trois architectures d'agents différentes.