MindTopo : un benchmark pour le raisonnement topologique des VLM
MindTopo évalue la capacité des modèles multimodaux à comprendre et manipuler des relations spatiales complexes comme la connectivité.
Microsoft Research·Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li·12 août 2026

Image · Source originale
Microsoft présente MindTopo, un nouveau benchmark testant le raisonnement topologique des modèles vision-langage (VLM). Il évalue leur compréhension de concepts comme la connectivité, l'enfermement ou les nœuds, tant en reconnaissance statique qu'en planification d'actions. Les résultats révèlent que si les modèles performent bien à l'observation, ils échouent souvent à maintenir ces relations structurelles dans des tâches interactives.