MCR-Bench : benchmark dynamique pour la revue de code
Un nouveau dataset évalue la capacité des LLM à gérer la revue de code sur plusieurs tours et dans des scénarios réels.
arXiv cs.AI · cs.LG · cs.CL·Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan·27 août 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark scientifique (ISSTA 2026) avec dataset de 2269 tâches et protocole multi-round.

Image · Source originale
MCR-Bench est le premier benchmark defect state-aware conçu pour la revue de code réaliste et multi-round. Il comprend 2 269 tâches couvrant cinq langages et annotées avec des métadonnées fines. Les expériences montrent que les LLM actuels ont des performances limitées qui se dégradent avec le nombre d'interactions.