La correction de vulnérabilités par LLM : pourquoi le taux de compilation est une métrique trompeuse
Une étude empirique montre que le taux de compilation, indicateur phare pour évaluer la réparation de code par IA, récompense en réalité les non-corrections.
arXiv cs.AI · cs.LG · cs.CL·Om Nepal, Sushant Aryal, Oluseyi Olukola, Nick Rahimi·22 septembre 2026
Lu et jugé par Fellow · impact notable
Étude empirique vérifiable sur 203 fonctions montrant qu'une métrique phare (compile rate) est fallacieuse et proposant une alternative (diff_F1) pour l'évaluation.

Image · Source originale
Sur 203 fonctions vulnérables de Big-Vul et trois LLM open-source, les auteurs démontrent que le taux de compilation ignore les vraies améliorations, dépend surtout d'artefacts d'évaluation, varie fortement selon les options du compilateur, et inverse même le classement des modèles par rapport aux métriques de similarité. Utilisé comme cible d'optimisation, il favorise des patches vides ou des suppressions de code plutôt que de réelles corrections. Ils proposent diff_F1, une métrique centrée sur la zone modifiée, comme alternative plus fiable.