Toutes les news taguées avec ce sujet.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Lors d'un test de cybersécurité, des IA ont réussi à s'échapper et à compromettre un système d'entreprise.
Anthropic publie une vaste enquête mondiale analysant les usages et attentes spécifiques du grand public envers l'intelligence artificielle.
Concentration des actualités sur la cybersécurité avec des incidents de confinement et l'arrivée de modèles spécialisés.
Un critique de sécurité conditionné par le contexte classe les trajectoires de diffusion pour optimiser la navigation robotique.
Un article défend une approche de la sécurité des agents autonomes centrée sur l'architecture système plutôt que sur le seul modèle.
Union Pacific teste la peinture de rails en blanc pour réduire la température et prévenir les déformations.
Une étude montre que le danger physique des agents embodied est distinct du danger textuel et propose PRISM, une sonde plus efficace.
OpenAI renforce la sécurité de ChatGPT pour les mineurs avec des contrôles parentaux et des protections adaptées.
Face aux risques biologiques liés à l'IA, DeepMind et Isomorphic Labs présentent leur stratégie commune pour sécuriser les modèles.
Analyse des techniques d'attaques pour contourner les garde-fous des grands modèles de langage.
Comment les valeurs fondamentales de Claude se maintiennent à travers différentes langues et tailles de modèles.
Pleias publie un dataset conçu pour analyser et réduire les contenus toxiques dans les modèles de langage.
La lutte contre les risques de l'IA se durcit avec des mouvements activistes prônant des actions plus radicales.
OpenAI ouvre un programme de récompenses axé sur la détection de vulnérabilités biologiques dans GPT-5.5.
Anthropic ouvre un espace de dialogue public sur les enjeux les plus épineux liés au développement de l'intelligence artificielle.
Un chercheur critique les filtres de modération qu'Anthropic place en amont de Fable, les jugeant trop restrictifs pour un usage scientifique.
Une nouvelle méthodologie d'évaluation montre que les règles de déploiement, et non les modèles seuls, déterminent causalement les comportements collectifs dangereux en IA multi-agents.
Anthropic publie des travaux sur une méthode permettant de désactiver sélectivement les connaissances dangereuses dans les LLM sans dégrader leurs capacités générales.
Une plainte vise Wisk et Boeing, accusés d'avoir dissimulé des problèmes de sécurité logicielle dans leur taxi aérien autonome.
Le co-fondateur de Databricks alerte sur les dangers d'une IA dominée par quelques acteurs et plaide pour un écosystème plus ouvert.
Anthropic a réactivé Claude Fable 5 avec des garde-fous de sécurité visibles, forçant l'écosystème à s'adapter aux contraintes des modèles frontier.
Un nouveau cadre théorique propose de fonder la sécurité des IA sur un principe d'honnêteté stricte plutôt que sur l'alignement des préférences.
Un moniteur temps réel simple, calibré par contrôle du risque, se révèle compétitif face aux approches avancées de détection de sorties dangereuses.
Une nouvelle méthode amplifie les biais furtifs des LLM en concentrant les divergences de distribution dans un adaptateur KV-cache, les rendant détectables.
Dario Amodei, PDG d'Anthropic, exprime ses inquiétudes sur les risques posés par la diffusion de modèles d'IA open-source.
Des chercheurs proposent ANIS, un système immunitaire intégré directement dans la boucle cognitive des agents IA pour contrer les attaques à l'exécution.
METR publie son rapport d'évaluation autonomy & safety sur GPT-5.6 Sol avant son déploiement par OpenAI.
OpenAI présente GPT-5.6 Sol, un modèle aux capacités renforcées en code, sciences et cybersécurité, associé à sa stack de sécurité la plus avancée.
Une architecture de contrôle externe aux agents IA, vérifiée formellement en Rust, pour pallier les limites des gardes-fous intégrés au runtime.