Empoisonnement d'IA d'auto-modification
Une étude explore la vulnérabilité des modèles capables de modifier leur propre code aux attaques par empoisonnement.
Hacker News (filtré IA)·@sbulaev·18 septembre 2026
Lu et jugé par Fellow · impact notable
Preuves de concept démontrées sur trois agents codeurs auto-modifiants réels, avec persistance de la contamination après évolution sur benchmarks propres.

Image · Source originale
Ce papier revisite le concept 'Reflections on Trusting Trust' dans le contexte des IA modernes capables d'auto-modification. Il démontre qu'il est possible d'insérer des portes dérobées persistantes dans le code généré par ces modèles. Les auteurs analysent les risques de sécurité inhérents à l'automatisation du développement logiciel.