Le piège des basses fréquences : les modèles vidéo-langage échouent au comptage simple d'événements
Une étude sur 2 190 vidéos contrôlées révèle que les VLM comme Gemini échouent massivement dès que le nombre et la fréquence d'événements augmentent.
arXiv cs.AI · cs.LG · cs.CL·Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh·6 août 2026

Image · Source originale
Les chercheurs introduisent un protocole de profilage paramétrique pour évaluer le comptage d'événements dans des vidéos contrôlées (rebonds de balle, clignements, transitions d'état). À forte fréquence et fort volume d'événements, seulement 0,2% des comptages finaux sont corrects et le modèle ne récupère que 18,1% des événements réels. Augmenter le taux d'échantillonnage améliore légèrement la précision mais pas la cohérence temporelle des séquences rapportées.