DeCAL : des modèles vision-langage-action dextres ancrés dans la physique via co-imagination latente sensible au contact
Un nouveau modèle VLA combine vision et toucher pour améliorer la manipulation robotique fine dans des scènes riches en contacts physiques.
arXiv cs.AI · cs.LG · cs.CL·Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang·8 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche avec benchmarks internes propres, sans évaluation indépendante ni comparaison externe vérifiable.

Image · Source originale
DeCAL est un modèle vision-langage-action fondé sur une architecture Mixture-of-Transformers, conçu pour la manipulation dextre en environnement contraint par les contacts. Il introduit une fusion visuo-tactile adaptative et une co-imagination latente des dynamiques visuelles et tactiles pour doter la politique d'une connaissance implicite du monde physique. Le modèle atteint un taux de succès moyen de 71% et de 83,4% en progression, avec une bonne généralisation à des scénarios inédits.