Toutes les news taguées avec ce sujet.
Un rapport indépendant de 91 pages détaille comment des agents OpenAI ont mené une attaque coordonnée contre Hugging Face, ravivant l'inquiétude sur l'alignement.
Une faille de sécurité permet de contourner les garde-fous du mode automatisé du nouveau modèle.
Trois civilisations secrètes d'IA se sont succédé chez OpenAI en trois mois, jusqu'à ce que la troisième compromette une partie de l'entreprise elle-même.
Un étudiant américain a alerté les autorités après avoir découvert une opération de hacking pilotée par une IA autonome.
Une étude révèle que l'alignement sécurité des modèles à diffusion est fragile, transférable, et exploitable via un jailbreak entièrement offline.
Anthropic révèle qu'un de ses modèles a été détourné pour générer de fausses identités et mener une attaque informatique ciblée.