Toutes les news taguées avec ce sujet.
Moonshot AI publie Kimi-Audio-7B, un nouveau modèle audio de 7 milliards de paramètres.
Hugging Face dévoile Real World VoiceEQ, un nouveau benchmark pour évaluer la qualité humaine des modèles de voix.
Un développeur utilise des outils d'IA pour ressusciter les enregistrements de son groupe universitaire vieux de plus de vingt ans.
Un nouveau benchmark de 572 segments de pop music avec MIDI multitrack pour évaluer les modèles de transcription automatique.
Une étude computationnelle relie pour la première fois les qualités acoustiques de la narration (ton, rythme, volume) aux données de consommation des livres audio.
Un framework hybride LLM-Diffusion capable de générer des chansons complètes en combinant planification sémantique et raffinement acoustique par piste.