Vero : des agents IA capables de construire des dépôts logiciels formellement vérifiés ?
Un nouveau benchmark évalue si les agents IA peuvent produire, à l'échelle d'un dépôt entier, du code et des preuves formelles cohérents.
arXiv cs.AI · cs.LG · cs.CL·Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song·13 août 2026

Image · Source originale
Vero est le premier benchmark évaluant conjointement la génération de code et de preuves formelles au niveau d'un dépôt multi-modules complet. Il comprend 43 instances issues de projets réels en Python, Dafny, Verus et Coq, converties en dépôts Lean 4 avec spécifications et implémentations de référence. Un mécanisme d'audit permet aux agents de prouver l'insatisfiabilité de spécifications ou l'incorrection du code de référence, améliorant la fiabilité du benchmark. Les auteurs évaluent des configurations d'agents de codage de pointe avec accès à la chaîne d'outils Lean.