EmoRES-TTS : un pilotage vectoriel résiduel pour la génération de parole émotionnelle
Une méthode sans réentraînement décompose les vecteurs d'émotion pour mieux contrôler le TTS émotionnel, surpassant CoCoEmo sur plusieurs backbones.
arXiv cs.AI · cs.LG · cs.CL·Kuan-Po Huang, Haohe Liu, Puyuan Peng, Haibin Wu·29 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration technique incrémentale du contrôle émotionnel TTS, avec code et benchmarks vérifiables mais portée de recherche limitée.

Image · Source originale
Les chercheurs montrent qu'un vecteur d'émotion se décompose en une composante partagée (éloignement du neutre) et une composante résiduelle (direction vers l'émotion cible). EmoRES exploite cette décomposition pour piloter un modèle TTS figé sans réentraînement. Sur IEMOCAP, la méthode surpasse CoCoEmo sur IndexTTS-2 et CosyVoice2, avec des gains significatifs en corrélation de rang et en taux de reconnaissance d'émotion, confirmés par évaluation humaine.