Toutes les news taguées avec ce sujet.
Un nouveau framework injecte des représentations 3D dans les modèles vision-langage à partir de simples vidéos RGB, sans capteur additionnel.
Un cadre utilisant des outils spécialisés et le reinforcement learning pour améliorer la vérification de réclamations scientifiques.
Un nouveau mécanisme de récompense double pour ancrer le raisonnement des VLMs dans la réalité physique et réduire les hallucinations dans les tâches interactives.
Cortex propose une interface de planification hiérarchique reliant VLM et VLA pour réaliser des tâches robotiques complexes en plusieurs étapes.
Une nouvelle méthode structure la compression de tokens visuels comme un problème de maximisation submodulaire, filtrant le bruit textuel par entropie statistique.
Un nouveau paradigme de distillation pour LLM et VLM qui contourne l'illusion de privilège en routant dynamiquement la supervision token par token.
Un système hiérarchique combinant VLMs et modèles de vision 3D permet aux robots d'identifier et localiser des outils non conventionnels en monde ouvert.
Un nouveau benchmark teste la résistance de 18 modèles vision-langage aux corruptions visuelles sur des tâches de raisonnement OCR.
Une méthode pour explorer des galeries d'images générées selon des axes de variation sémantiques structurés, pilotés par un workflow agentique.