RECHERCHE
Test-Time Training pour la consistance de l'ordre modal dans les VLM
Les modèles vision-langage sont sensibles à l'ordre des entrées. Une méthode d'adaptation corrige ce biais et améliore les performances.
arXiv cs.AI · cs.LG · cs.CL·Aditi Gupta, Yossi Gandelsman·22 juillet 2026

Image · Source originale
Une étude révèle que les vision-language models (VLM) sont sensibles à l'ordre de présentation des données, l'ordre 'image d'abord' surperformant systématiquement. Les chercheurs proposent une méthode de test-time training asymétrique qui réduit cet écart et améliore la performance globale. L'analyse par activation patching localise le défaut à une région précise du réseau.