RECHERCHE
X³-OPD : distillation de raisonnement pour modèles audio-langage
Un nouveau cadre transfère le raisonnement logique de modèles textuels vers des modèles audio via un alignement on-policy.
arXiv cs.AI · cs.LG · cs.CL·Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang·23 juillet 2026

Image · Source originale
X³-OPD est un framework de distillation croisée qui transfère des capacités de raisonnement d'un modèle texte professeur vers un modèle audio-langage étudiant. Il utilise un corpus symétrique à trois niveaux couvrant le texte converti en parole, le raisonnement sur événements audio et le dialogue oral. Les expériences montrent une amélioration significative du raisonnement audio et de la qualité du chain-of-thought.