Agile-WAM : un modèle monde-action tactile agile pour le contrôle robotique en contact riche
Un nouveau modèle combine vision et toucher pour prédire actions et dynamiques physiques, plus rapide que les backbones génératifs classiques.
arXiv cs.AI · cs.LG · cs.CL·Hanchu Zhou, Brendan Lynch, Raman Goyal, Dechen Gao·17 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche préprint avec gains mesurés (29,4% succès, 11,9ms) mais non revu par pairs et non couvert ailleurs.

Image · Source originale
Agile-WAM encode observations visuelles et tactiles dans un espace latent partagé pour générer, via flow-matching, des actions et des prédictions futures multimodales. Le modèle exploite des horizons temporels différenciés selon la modalité, la vision évoluant plus lentement que le tactile lors des contacts. Testé sur neuf tâches simulées et cinq tâches réelles de manipulation, il surpasse les meilleures baselines en taux de réussite tout en réduisant la latence d'inférence.