R³ : entraîner des robots à raisonner en langage naturel via reinforcement learning
Une méthode de post-training transforme des VLMs standards en raisonneurs robotiques capables de guider des politiques de manipulation complexes.
arXiv cs.AI · cs.LG · cs.CL·Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang·26 août 2026
Lu et jugé par Fellow · impact léger
Résultats limités à deux testbeds contrôlés (Language Table, packing simulé), pas de validation sur robots réels ni benchmark externe.

Image · Source originale
R³ combine un mid-training sur des traces de raisonnement expertes et un RL basé sur des rubriques pour entraîner des VLMs à produire un raisonnement en langage libre guidant des politiques bas niveau. Testée sur Language Table et un scénario simulé de packing bimanuel, la méthode améliore l'exploration et la généralisation, surpassant les baselines d'imitation par instructions seules.