QuoteBench : comment des scores identiques masquent des échecs liés au transport des commandes
Une nouvelle étude montre que les scores d'exécution agrégés dissimulent des erreurs introduites après la génération, faussant l'évaluation des agents Bash.
arXiv cs.AI · cs.LG · cs.CL·Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang·13 août 2026

Image · Source originale
QuoteBench évalue 56 tâches issues de 14 familles d'incidents pour distinguer les erreurs de génération de commandes des défaillances liées au transport d'exécution. Rejouer les mêmes réponses via un parser non échappé fait chuter le succès de 55 à 73 points, la divulgation de la contrainte ne compensant que partiellement selon les configurations. Les auteurs appellent à documenter systématiquement la configuration du modèle, le contrat de génération et le validateur d'état final plutôt que de traiter le score agrégé comme une propriété intrinsèque du modèle.