Show-Harness : un agent VLM capable de piloter des robots
Une interface sémantique compacte permet aux modèles vision-langage de contrôler des robots par zero-shot ou fine-tuning rapide.
arXiv cs.AI · cs.LG · cs.CL·Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng·9 septembre 2026
Lu et jugé par Fellow · impact notable
Le papier propose une interface concrète validée par expériences pour adapter les VLM au contrôle robotique en zero-shot ou avec peu de ressources.

Image · Source originale
Show-Harness est une interface incarnée qui relie les intentions aux actions, permettant aux VLM de piloter des robots via des unités sémantiques discrètes. Elle permet d'utiliser des modèles fermés en zero-shot ou d'adapter des modèles open-source avec peu de ressources. Les expériences montrent une généralisation robuste sur diverses tâches et environnements.