SWE-Serve révèle l'écart entre tests locaux et déploiement en production
Un patch d'agent de codage IA peut réussir tous les tests mais échouer une fois le modèle chargé et confronté à de vraies requêtes.
NVIDIA Developer Blog·Elizabeth Goodman·23 septembre 2026

Image · Source originale
NVIDIA présente SWE-Serve, un benchmark de 53 tâches développé avec l'équipe SGLang pour évaluer les modifications de logiciels d'inference-serving sur l'ensemble du pipeline, pas seulement en tests unitaires. L'objectif est de vérifier que le système renvoie des résultats corrects via son interface publique, une fois le modèle réellement chargé en production.