RECHERCHE
VLM-IE3D : des VLM conscients de la 3D grâce à des géométries implicites et explicites
Un nouveau framework injecte des représentations 3D dans les modèles vision-langage à partir de simples vidéos RGB, sans capteur additionnel.
arXiv cs.AI · cs.LG · cs.CL·Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao·23 juillet 2026

Image · Source originale
VLM-IE3D dote les VLM classiques de tokens géométriques implicites et explicites extraits de vidéos RGB, combinés via un adaptateur 3D. Cette approche améliore les performances sur la détection 3D, l'ancrage visuel, le captioning dense et le raisonnement spatial, sans nécessiter de données 3D supplémentaires. Le code et les modèles sont publiés en open source.