RECHERCHE
ActiveVision : un benchmark révèle l'échec des MLLMs sur l'observation visuelle active
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
arXiv cs.AI · cs.LG · cs.CL·Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu·17 juillet 2026

Image · Source originale
ActiveVision est un nouveau benchmark de 17 tâches conçu pour tester si les MLLMs exercent une observation visuelle active, comme le fait la vision humaine par des allers-retours du regard. Les modèles les plus performants, dont GPT-5.5 et Claude Fable 5, échouent largement (10,6% et 3,5% de réussite) contre 96,1% pour des humains. Le problème persiste même quand les modèles génèrent et exécutent leur propre code de vision, révélant un manque structurel de perception active.