Toutes les news taguées avec ce sujet.
Des revueurs IA ont validé du code malveillant en suivant les instructions d'un ticket faux.
Le pentesting doit évoluer pour évaluer les dérives comportementales, au-delà de la simple compromission des ressources.
Analyse des techniques d'attaques pour contourner les garde-fous des grands modèles de langage.
OpenAI présente GPT-Red, un mécanisme de self-play conçu pour renforcer la robustesse des modèles face aux prompt injections.
Un chercheur détaille une technique de manipulation permettant d'extraire des informations sensibles stockées dans la mémoire de Claude.
Des chercheurs proposent Prismata, un mécanisme de confinement des attaques par injection de prompt cross-site visant les agents web autonomes.
Des chercheurs en sécurité ont exploité une faille d'injection de prompt dans Copilot Workspace pour accéder à des dépôts GitHub normalement inaccessibles.
Des utilisateurs signalent qu'Anthropic intègrerait des instructions système dissimulées dans Claude, soulevant des questions de transparence.
Un développeur analyse les résultats d'une expérience publique d'adversarial prompting sur son assistant IA juridique, après 2 000 tentatives de jailbreak.
Les jailbreaks et injections de prompts indirectes reviennent au centre du débat sécurité IA après les contrôles à l'export américains sur Mythos et Fable.