SWE-Gate : réussir les tests fonctionnels ne suffit pas pour les agents d'ingénierie logicielle
Un nouveau benchmark révèle qu'un tiers des correctifs validés par les tests fonctionnels ignorent les contraintes de revue de code réelles.
arXiv cs.AI · cs.LG · cs.CL·Xin He, Yanlin Wang, Mingwei Liu, Jiachi Chen·3 septembre 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark chiffré (303 instances, 75 dépôts) montrant que 221/644 correctifs validés fonctionnellement violent des contraintes de revue réelles.

Image · Source originale
SWE-Gate est un benchmark évaluant les agents de codage non seulement sur la réussite des tests fonctionnels, mais aussi sur le respect des contraintes issues de vraies revues de pull requests. Construit à partir de 303 instances de réparation sur 75 dépôts Python open source, il montre que sur 644 correctifs passant les tests fonctionnels, 221 ne respectent pas les contraintes de revue fournies. Les auteurs concluent que l'évaluation purement fonctionnelle surestime la capacité réelle des agents à traiter des tâches complètes de réparation de code.