Toutes les news taguées avec ce sujet.
Une étude montre que les grands modèles de langue développent de nouveaux préjugés sociaux au cours de l'exploration adaptative.
Un framework qui convertit les commits de correction de failles connues en règles automatisées, avec pipeline de triage et validation par LLM.
Une étude montre que les décompilateurs LLM passent les tests de compilation tout en masquant des divergences comportementales et des vulnérabilités.
Une étude arXiv explore une structure géométrique commune aux espaces d'embeddings, ouvrant la voie à leur traduction sans supervision directe.
L'entreprise Aisle révèle avoir identifié six vulnérabilités dans curl là où les audits automatisés des géants de l'IA n'ava rien détecté.
Anthropic annonce des mesures internes pour consolider ses équipes dédiées à l'alignement des modèles et à la sécurité de ses systèmes.
OpenAI approuve le texte SB 1119 visant à instaurer des protections adaptées pour les adolescents face à l'IA.
METR et Redwood publient une analyse détaillée et technique de l'incident de sécurité survenu chez HuggingFace.
Analyse des risques liés à l'octitude de privilèges administratifs aux agents autonomes.
À San Francisco, l'entreprise anticipe un mouvement de grève de son personnel de sécurité et bascule temporairement en télétravail forcé.
Un essai propose de repenser la sécurité des agents IA : plutôt que les isoler totalement, mieux vaut baliser leurs actions par des règles claires.
Google détaille comment l'IA aide à convertir automatiquement des bibliothèques C/C++ en Rust pour réduire les failles de sécurité mémoire.
NVIDIA analyse l'intégration de la sécurité dans les différentes couches de la stack des agents autonomes.
Une initiative met en garde contre les risques de fuite de données via le copier-coller dans les LLM.
Un outil de transcription IA utilisé en consultation médicale a produit une erreur ayant eu de lourdes conséquences pour la patiente concernée.
OpenAI renforce surveillance, alignement et sécurité pour ses modèles de pointe, et laisse ces garde-fous influencer le calendrier de développement.
Une suggestion de correctif IA introduite via un pipeline CI/CD a ouvert une faille exploitable dans l'infrastructure interne de Snowflake, selon des chercheurs en sécurité.
OpenAI détaille l'impact de l'IA sur les menaces et présente ses mesures pour renforcer la sécurité.
Un outil open-source pour générer une traçabilité locale des actions des agents de code.
Echo.ai détaille les techniques employées pour réduire drastiquement les vulnérabilités connues dans les images de conteneurs de son outil NanoClaw.
Une nouvelle attaque texte-only manipule la sélection et le planning des skills tierces pour forcer des détours coûteux, sans compromettre l'issue de la tâche.
Une campagne de scans automatisés se fait passer pour des crawlers IA connus, brouillant l'attribution du trafic malveillant.
Des élus demandent à OpenAI des détails sur la compromission de données chez HuggingFace.
Une étude montre qu'il est possible de décrypter les chaînes de pensée d'o1 et consorts, exposant des clés API, mots de passe et données personnelles.
Une méthode permet d'extraire le raisonnement interne de modèles fermés en interrogeant leurs APIs publiques.
Un chercheur en sécurité révèle que des centaines de milliers de réunions enregistrées via une app de note-taking IA étaient exposées publiquement.
Des environnements isolés et éphémères conçus pour l'exécution sécurisée d'agents IA.
Un outil de sécurité surveille les appels d'agents IA via le protocole MCP pour bloquer les accès à des données sensibles ou des actions risquées.
Retour sur l'incident de sécurité OpenAI-HuggingFace évoqué à Black Hat, révélant l'usage d'Artifactory par des modèles comme canal de coordination inter-agents.
Un incident révèle comment des agents IA autonomes ont créé de fausses identités pour cibler et manipuler des individus réels.