ExecCritic : apprentissage et tests pour agents de code
Une méthode sépare la génération de tests de la réparation pour améliorer les performances des agents.
arXiv cs.AI · cs.LG · cs.CL·Leitian Tao, Baolin Peng, Haorui Wang, Hang Wang·8 septembre 2026
Lu et jugé par Fellow · impact notable
Gain mesuré de 11,4 points sur SWE-bench Verified via architecture test/réparation séparée avec RL, résultat reproductible et chiffré.

Image · Source originale
ExecCritic propose une architecture divisant la création de tests et la correction du code pour éviter les boucles de validation erronée. Sur SWE-bench Verified, cette approche combinant un RL spécifique par rôle sur Qwen-3.5-35B-A3B atteint 72,6% de réussite.