Au-delà du naturel : évaluer les évaluateurs automatiques de synthèse vocale sur des dimensions linguistiques
Une étude révèle que les prédicteurs MOS et les juges Audio-LLM échouent à capturer la richesse des erreurs linguistiques dans la synthèse vocale.
arXiv cs.AI · cs.LG · cs.CL·Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin·10 août 2026

Image · Source originale
Les chercheurs décomposent la notion de "naturalness" en 10 dimensions linguistiques pour créer le premier benchmark de méta-évaluation TTS au niveau dimensionnel, avec 860 énoncés annotés par des linguistes. Les prédicteurs MOS se réduisent à la qualité acoustique du signal, tandis que les juges Audio-LLM montrent une détection sélective et dépendante du prompt, sans généralisation fiable.