DexTacWAM : un modèle monde-action visuo-tactile pour la manipulation dextre
Un nouveau modèle combine vision et toucher pour prédire les dynamiques de contact, surpassant nettement les approches purement visuelles.
arXiv cs.AI · cs.LG · cs.CL·Haoran Yuan, Zekai Wang, Boning Shao, Haoran Lu·21 septembre 2026
Lu et jugé par Fellow · impact notable
Résultat de recherche vérifiable avec un saut de performance significatif (70,6 vs 38,0) sur 6 tâches, mais portée limitée à la manipulation robotique dextre en simulation.

Image · Source originale
DexTacWAM encode chaque doigt indépendamment et injecte un latent tactile dans un modèle monde vidéo par diffusion pour modéliser conjointement vision et toucher. Sur six tâches de manipulation dextre à fort contact, il obtient un score moyen de 70,6 contre 38,0 pour la meilleure référence. L'ablation montre que modéliser l'évolution du contact comme partie de l'état du monde prédit est déterminant, bien plus qu'un simple conditionnement tactile.