WorldCrafter : modèle vidéo du monde cohérent avec mémoire implicite 3D
Un nouveau modèle génère des explorations vidéo cohérentes sur plusieurs minutes grâce à une mémoire 3D interrogeable par point de vue.
arXiv cs.AI · cs.LG · cs.CL·Wangbo Yu, Kunhao Liu, Wenbo Hu, Shenghai Yuan·21 septembre 2026
Lu et jugé par Fellow · impact notable
Recherche avec résultats vérifiables : gains documentés en cohérence long terme et précision caméra pour l'exploration vidéo sur plusieurs minutes.

Image · Source originale
WorldCrafter est un modèle vidéo du monde qui apprend une mémoire 3D implicite interrogeable par caméra pour maintenir la cohérence des observations sur de longs horizons et différents points de vue. Un encodeur de mémoire et un module de lecture conditionné par la pose compressent les observations passées en tokens spécifiques au point de vue cible, sans correspondances de profondeur explicites. Combiné à un contexte temporel récent et à une distillation en peu d'étapes, le système permet une exploration en streaming à partir d'une seule image ou d'un prompt texte, avec des gains notables en cohérence et précision du contrôle caméra.