EarlyEval : réduire le coût de l'évaluation des agents grâce à la prédiction précoce des résultats
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.
arXiv cs.AI · cs.LG · cs.CL·Yuling Shi, Zhensu Sun, Junsen Dong, Chengcheng Wan·2 septembre 2026
Lu et jugé par Fellow · impact léger
Méthode incrémentale utile pour réduire le coût d'évaluation d'agents, mais portée limitée à un outillage de recherche.

Image · Source originale
Évaluer des agents LLM sur des benchmarks coûte cher, chaque passage pouvant atteindre plusieurs milliers de dollars. EarlyEval entraîne des classifieurs LightGBM qui détectent le succès ou l'échec d'un agent à partir de son comportement intermédiaire, arrêtant l'exécution dès qu'un seuil de confiance est atteint. Sur trois benchmarks (SWE-bench Verified, TerminalBench, Toolathlon), la méthode élimine 13-26% des étapes et jusqu'à 44,1% des tokens d'entrée, avec une précision de 89-97% et un impact minime sur les taux de résolution.