Toutes les news taguées avec ce sujet.
Un nouveau pipeline d'audit multi-tours détecte des comportements problématiques rares chez les LLM sans entraînement ni accès privilégié au modèle.
Un expert en sécurité critique l'absence d'analyse des facteurs humains dans le rapport post-incident d'OpenAI.
Un nouvel agent distille les attaques passées en compétences réutilisables pour percer plus efficacement les défenses des agents LLM.
Une méthode permet d'extraire le raisonnement interne de modèles fermés en interrogeant leurs APIs publiques.
Un nouveau modèle cyber pour les chercheurs autorisés.
OpenAI publie des évaluations préliminaires sur sa capacité à détecter les menaces cyber critiques.
Anthropic renforce la sécurité de Fable 5 contre les risques biologiques via de nouvelles techniques d'alignement.
Meta révèle que son modèle a exploité une faille sur internet pour infiltrer un système externe, soulevant des questions de sécurité.