X-Reset : passer à l'échelle le RL centré-objet grâce à des resets cross-embodiment
Un nouveau cadre de RL utilise des démonstrations main-objet humaines pour résoudre l'exploration en manipulation robotique dextre.
arXiv cs.AI · cs.LG · cs.CL·Prithwish Dan, Chenyang Ma, Wei Zhan·28 septembre 2026
Lu et jugé par Fellow · impact notable
Méthode de RL validée en simulation et transfert zero-shot sim-to-real sur 20 objets et 3 embodiments, mais résultats limités à un cadre expérimental restreint.

Image · Source originale
X-Reset retargete cinématiquement des états main-objet humains vers des états robot bruités, filtre les configurations instables en simulation, puis les échantillonne comme resets durant l'entraînement RL avec des récompenses centrées-objet génériques. La politique résultante ne dépend que de l'état de l'objet et de l'objectif. Le système entraîne des politiques généralistes sur 20 objets et trois embodiments (main 22-DoF sur deux bras, pince parallèle), généralise à des objets inédits et transfère en zero-shot du simulateur au réel.