MP-Bench : évaluer les agents vocaux dans des conversations à plusieurs locuteurs
Un nouveau benchmark révèle que les agents vocaux temps réel échouent largement à gérer les tours de parole en conversation multipartite.
arXiv cs.AI · cs.LG · cs.CL·Yi-Jen Shih, Shih-Yun Shan Kuan, Guan-Ting Lin, Kai-Wei Chang·11 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark académique (accepté EMNLP Findings) sur un problème de niche, sans nouveau modèle ni déploiement.

Image · Source originale
Les chercheurs présentent MP-Bench, premier benchmark évaluant les agents vocaux conversationnels comme participants actifs dans des échanges à plusieurs interlocuteurs. L'évaluation porte sur la gestion des tours de parole et la pertinence des réponses, complétée par des tâches de compréhension. Sur 12 agents vocaux testés, les performances plafonnent à 22% en compréhension multipartite et restent proches du hasard pour la gestion des tours de parole.