VLoc Bench : évaluer la localisation de vulnérabilités par des agents à l'échelle d'un dépôt
Un nouveau benchmark de 500 vulnérabilités réelles révèle les limites des agents LLM pour localiser précisément le code vulnérable dans un dépôt.
arXiv cs.AI · cs.LG · cs.CL·Aman Priyanshu, Supriti Vijay, Kimia Majd, Xuhong He·14 septembre 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark technique rigoureux (VLoc Bench) documentant les lacunes actuelles des agents sur une tâche de sécurité critique.

Image · Source originale
VLoc Bench évalue 27 modèles de langage et quatre outils d'analyse statique sur leur capacité à localiser des vulnérabilités connues dans des dépôts logiciels réels, avant et après correction. Le meilleur système n'atteint que 0,229 en File F1, et 38,4% des tâches ne sont résolues correctement par aucun modèle. Les auteurs montrent aussi qu'une bonne localisation avant patch n'implique pas un comportement fiable après remédiation.