Documentation compacte pour agents de codage : un benchmark, un optimiseur, et pourquoi ça ne se transfère pas
Une étude montre que la documentation générée automatiquement, même optimisée, n'améliore pas la résolution d'issues réelles par des agents de codage.
arXiv cs.AI · cs.LG · cs.CL·Md Shohel Arman, Igor Molybog·25 septembre 2026

Image · Source originale
Les auteurs créent un benchmark de type roundtrip pour évaluer la fidélité des descriptions de code, et trouvent qu'un prompt optimisé atteint une fidélité totale et généralise bien. Mais testée sur deux familles de modèles et dix dépôts, cette documentation ne permet pas d'améliorer la résolution d'issues réelles par rapport à l'issue seule, malgré un contrôle positif validant la méthode d'évaluation.