Toutes les news taguées avec ce sujet.
Cortex propose une interface de planification hiérarchique reliant VLM et VLA pour réaliser des tâches robotiques complexes en plusieurs étapes.
Un nouveau modèle Vision-Language-Action permet aux robots d'opérer depuis n'importe quel angle de caméra sans nécessiter de calibration extrinsèque préalable.
Une approche en deux étapes qui sépare compétence motrice et alignement sémantique pour réduire drastiquement le besoin en données expertes.
Des chercheurs présentent FurnitureVLA, premier système robotique bimanuels capable d'assembler des meubles réels grâce à un modèle Vision-Language-Action.
Un nouveau framework en deux étapes pré-entraîne le module d'action d'un modèle VLA avec des priors de mouvement avant l'alignement cross-modal.
Un framework permet aux modèles vision-langage-action d'apprendre de nouvelles compétences robotiques sans démonstrations humaines, grâce à un volant de données guidé par VLM.