VISTA : un harnais visuel pour le raisonnement dans un monde interactif
Un nouveau harnais visuel dote les modèles multimodaux d'une mémoire longue durée, propulsant Claude Opus 5.0 à un score parfait sur ARC-AGI-3.
arXiv cs.AI · cs.LG · cs.CL·Qiushi Han, Keya Hu, Linlu Qiu, Cathy Wu·1 octobre 2026

Image · Source originale
VISTA est un harnais visuel qui donne aux modèles multimodaux une mémoire visuelle persistante et sans perte, permettant de récupérer et réorganiser les observations passées pendant le raisonnement. Appliqué à Claude Opus 5.0 sur ARC-AGI-3, il fait passer le score d'efficacité relative à l'humain de 40,68 à 100,00, avec moins d'actions que les joueurs humains novices. Le harnais généralise aussi à d'autres environnements visuels et surpasse des baselines à harnais minimal.