SWE-Serve : benchmark de l'ingénierie agentic pour le service d'inférence en production
Un nouveau benchmark évalue la capacité des agents à implémenter des fonctionnalités d'inférence en production, révélant un écart critique entre succès local et validité réelle.
arXiv cs.AI · cs.LG · cs.CL·Jennifer Williams, Dave Farris, Jeff Farris, Jiantao Jiao·22 septembre 2026·+ 1 source Lu et jugé par Fellow · impact notable
Benchmark SWE-Serve (NVIDIA/SGLang) de 53 tâches réelles documenté sur arXiv, mesurant un écart critique entre succès local et validité en production.
Article composé de 2 sources

Image · Source originale
SWE-Serve, benchmark NVIDIA/SGLang de 53 tâches d'ingénierie d'inférence en production, dérivées de modifications réelles sur SGLang. Il évalue le chemin de service complet (tests fonctionnels, régression, E2E via l'interface publique), révélant un écart entre réussite des tests locaux et correction réelle en production, avec un taux de succès plafonnant à 75%.