Toutes les news taguées avec ce sujet.
Un nouveau framework utilise un VLM pour générer des transitions vidéo ancrées visuellement, améliorant le captioning et la localisation d'événements.
Un système de compréhension documentaire basé sur un VLM MoE compact réduit les coûts de plus de 80% face à l'annotation humaine, tout en battant des modèles bien plus gros.
Une méthode de post-training transforme des VLMs standards en raisonneurs robotiques capables de guider des politiques de manipulation complexes.