SWE-Flux : un benchmark dynamique au niveau de dépôt pour évaluer le raisonnement sur l'exécution des LLM
Les LLM peinent à raisonner sur le comportement à l'exécution du code. SWE-Flux propose 480 instances testées automatiquement pour mesurer cette lacune.
arXiv cs.AI · cs.LG · cs.CL·Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband, Hridya Dhulipala·23 septembre 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark SWE-Flux avec 480 instances fondées sur l'exécution réelle ; résultats chiffrés (max 37 %) confirmant une lacune réelle des LLM.

Image · Source originale
Les LLM sont de plus en plus utilisés pour le code, mais leur capacité à raisonner sur l'exécution reste floue. SWE-Flux comble ce manque avec un benchmark au niveau de dépôt contenant 480 instances fondées sur l'exécution réelle de 12 projets Python. Les réponses sont collectées automatiquement via des tests instrumentés. Les cinq modèles évalués obtiennent au mieux 37 % de précision, échouant notamment sur les flux de données et le raisonnement inter-procédural.