DiaVLo : un framework de diagnostic des comportements des modèles vision-langage
DiaVLo détecte les désalignements comportementaux des VLM et identifie les concepts causaux qui orientent leurs réponses, favorisant un déploiement plus fiable.
arXiv cs.AI · cs.LG · cs.CL·Lorenzo Corti, Jie Yang·18 septembre 2026
Lu et jugé par Fellow · impact notable
Framework avec évaluations sur plusieurs VLM et estimations causales, accepté à EMNLP 2026 ; avance incrémentale pour le diagnostic de sécurité.

Image · Source originale
DiaVLo est un framework de diagnostic pour les modèles vision-langage (VLM). Il combine curation humaine et génération du modèle pour spécifier les comportements attendus et observés, révélant ainsi les désalignements. Il fournit également des estimations causales des concepts les plus influents sur ces comportements. Les évaluations sur plusieurs VLM open-weights montrent que DiaVLo produit des étiquettes corrélées à la performance et met en évidence des patterns de perception et de priorisation des concepts.