Les LLM à diffusion, cibles et armes : exploits mécanistiques contre leurs garde-fous de sécurité
Une étude révèle que l'alignement sécurité des modèles à diffusion est fragile, transférable, et exploitable via un jailbreak entièrement offline.
arXiv cs.AI · cs.LG · cs.CL·Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant·7 août 2026

Image · Source originale
Les chercheurs montrent que les DLLM (LLaDA, Dream, Fast-dLLM) héritent des vulnérabilités mécanistiques de leurs prédécesseurs autorégressifs, permettant des attaques par pruning de neurones de sécurité avec des taux de succès allant jusqu'à 86,6%. Ils introduisent SN-Guided Diffusion, un framework de jailbreak black-box qui atteint jusqu'à 86,9% de succès de transfert contre Qwen2.5 et 74,3% contre Gemini-2.5-Flash-Lite, avec seulement 20 générations par prompt.