Reconstruct, Practice, Go Real : auto-amélioration guidée pour agents incarnés
Un framework fait progresser des robots manipulateurs de 28,6% à 95% de réussite sans retoucher les poids du modèle, via simulation et skills symboliques.
arXiv cs.AI · cs.LG · cs.CL·Yen-Jen Wang, Haozhe Jiang, Shuying Deng, Haoru Xue·1 octobre 2026
Lu et jugé par Fellow · impact notable
Papier de recherche avec résultats chiffrés reproductibles (28,6%→95%) et validation sur 30 essais physiques réels, mais une seule source et non indépendamment vérifié.

Image · Source originale
RPG identifie des capacités de manipulation dans un dataset offline, construit des tâches d'entraînement en simulation, puis diagnostique les échecs pour créer ou affiner des skills symboliques réutilisables et ajuster le system prompt. Sur 22 tâches de manipulation, le taux de succès passe de 28,6% à 95,0% après 15 rounds, devançant ASPIRE (75,5%) et CaP-Agent0 (60,0%). En conditions réelles, le système figé réussit les 30 essais physiques testés.