LACE : compression couche par couche pour les codecs audio à débit de trame dynamique
Un nouveau codec neuronal applique une compression indépendante à chaque couche de quantification pour améliorer l'efficacité des systèmes de synthèse vocale.
arXiv cs.AI · cs.LG · cs.CL·Thanapat Trachu, Samuele Cornell, William Chen, Shinji Watanabe·15 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'un codec audio neuronal, acceptée à SLT 2026, sans déploiement ni impact au-delà de la recherche.

Image · Source originale
LACE introduit une compression adaptative par couche dans les codecs audio neuronaux, permettant des frontières de segmentation spécifiques à chaque niveau de quantification. Des mécanismes d'alignement et d'ancrage assurent la cohérence des durées pour l'usage en text-to-speech. Testé sur LibriTTS, LACE améliore le compromis débit-qualité et l'efficacité d'inférence tout en conservant une qualité de synthèse compétitive.