Penser avant de penser : passer à l'échelle l'inférence agentique par méta-raisonnement
Un contrôleur explicite gère les choix d'exécution des agents (poursuivre, repartir, s'arrêter), avec des gains mesurés sur plusieurs benchmarks long-horizon.
arXiv cs.AI · cs.LG · cs.CL·Paras Dahal, Anton Bakhtin, Taco Cohen, Zhengxing Chen·29 septembre 2026

Image · Source originale
Les chercheurs introduisent le « méta-raisonnement agentique », un harnais d'inférence où un contrôleur structuré arbitre les décisions de contrôle pendant qu'un ensemble de workers exécute les tâches. Sur ProgramBench, cette approche atteint 71,5% avec GPT-5.5 contre 58,0% pour Codex, et 67,2% avec Opus 4.8 contre 65,5% pour Claude Code. Sur d'autres benchmarks de raisonnement long-horizon, le gain moyen est de 3,6 à 4,2 points par rapport au contrôle direct, avec une meilleure tenue sur de grands budgets de calcul.