SUN : des programmes persistants pour unifier contrôle, apprentissage et politiques réelles guidées par le langage
Un nouveau système, Kuafu, synthétise automatiquement des programmes sémantiques pour entraîner des politiques robotiques sans démonstrations ni récompenses manuelles.
arXiv cs.AI · cs.LG · cs.CL·Weiqi Wang, Zhi Li, Yudong Lei, David Martinez·31 août 2026
Lu et jugé par Fellow · impact léger
Preprint arXiv non évalué par les pairs, résultats sur benchmarks internes propres à l'équipe sans comparaison indépendante.

Image · Source originale
Les chercheurs proposent les SUN Programs, des exécutables typés reliant contrôle prédictif (MPC), récompenses RL et diagnostics à partir de relations géométriques définies une seule fois. Le système Kuafu, piloté par des modèles vision-langage, génère ces programmes depuis le langage et la sémantique de la scène. Sur neuf tâches, il atteint 82,03% de succès moyen, contre 35,67% et 24,75% pour les méthodes de référence, et améliore l'entraînement de politiques en simulation comme sur robots physiques.