Inversion temporelle de gradients pour la reconstruction de trajectoires privées en RL incarnée
Une nouvelle attaque par inversion de gradients exploite la structure temporelle des gradients de politique pour reconstituer quasi-parfaitement les trajectoires privées des agents en RL incarnée.
arXiv cs.AI · cs.LG · cs.CL·Sudip Bhujel, Shanghao Shi, Ruiquan Huang, Ning Zhang·24 septembre 2026
Lu et jugé par Fellow · impact notable
Attaque d'inversion de gradients acceptée à NeurIPS 2026, avec résultats quantifiés (18,8 dB PSNR) sur architectures multiples, mais recherche exploratoire sans déploiement réel.

Image · Source originale
L'apprentissage distribué en reinforcement learning incarné transmet au serveur uniquement les gradients de politique, offrant une certaine confidentialité. Cependant, la structure temporelle amplifie les fuites de données. Les auteurs introduisent TRACE, une attaque d'inversion temporelle autoregressive qui exploite les corrélations inter-étapes et la récupération exacte des actions pour reconstruire les trajectoires privées. TRACE atteint 18,8 dB de PSNR avec une récupération d'actions quasi-parfaite, surpassant les méthodes antérieures en qualité et en rapidité.