L'illusion d'alignement dans les modèles de langage multimodaux
Les métriques classiques d'alignement visuel-textuel dans les MLLMs masquent une absence réelle d'intégration : la similarité mesurée est souvent un artefact des poids du réseau.
arXiv cs.AI · cs.LG · cs.CL·Hong-Han Wang, Yuntao Wang, Hu Ding·24 septembre 2026
Lu et jugé par Fellow · impact notable
Étude NeurIPS 2026 avec expérimentation sur 13 MLLMs révélant une faille méthodologique des métriques d'alignement standard.

Image · Source originale
La similarité couche par couche dans les MLLMs est souvent interprétée comme une intégration progressive des contenus visuels. Ce travail montre que les métriques scalaires (CKA, SVCCA, MIR) échouent à distinguer un flux visuel corrompu d'un flux original sur 13 modèles. Ce phénomène, nommé « alignment illusion », provient de projections MLP anisotropes qui attirent les tokens vers des directions communes. Les auteurs proposent le principal-angle gap (PA gap), qui sépare cette similarité induite de la structure visuelle réelle et corrèle mieux avec la précision des tâches.