Faire évoluer le harnais, pas le contexte : des agents génériques aux spécialistes réutilisables
Une méthode transforme les décisions de contrôle récurrentes des agents LLM en code exécutable réutilisable, réduisant drastiquement le nombre d'appels au modèle.
arXiv cs.AI · cs.LG · cs.CL·Laizhen Li, Jiarui Li, Juanjuan Zhao, Kejiang Ye·22 septembre 2026
Lu et jugé par Fellow · impact notable
Résultats chiffrés sur deux benchmarks avec réduction vérifiable de 76-92% des appels LLM, mais pas de code public ni indépendamment vérifié.

Image · Source originale
Growing Harness apprend un harnais d'agent à partir des échecs d'exécution, en localisant les erreurs, en les corrigeant par lots et en validant les modifications avant intégration. Testée sur BrowseComp-Plus et WebArena-Verified avec des modèles de 4B à 120B paramètres, la méthode obtient les meilleurs taux de succès dans cinq configurations sur six, tout en réduisant les appels LLM de 76 à 92% et les coûts d'inférence jusqu'à 98,6%.