Toutes les news taguées avec ce sujet.
Un modèle multimodal apprend à construire une représentation 3D compacte de la scène pour raisonner comme un humain avant de formuler sa réponse.