Imagine3D-LLM : apprendre aux MLLM à imaginer une scène 3D avant de répondre
Un modèle multimodal apprend à construire une représentation 3D compacte de la scène pour raisonner comme un humain avant de formuler sa réponse.
arXiv cs.AI · cs.LG · cs.CL·Jaewoo Jung, Hyeonseo Yu, Honggyu An, Jisang Han·29 septembre 2026

Image · Source originale
Les MLLM peinent à intégrer des indices multi-vues en une compréhension 3D cohérente. Imagine3D-LLM ajoute des tokens résumés décodés en une représentation compacte de type 3D Gaussian Splatting, entraînée avec une perte photométrique conjointe à la prédiction de tokens. Cette supervision renforce aussi la correspondance inter-vues dans les features internes du modèle.