Illisibilité linguistique et sécurité des LLM
Les mécanismes de sécurité basés sur le langage sont intrinsèquement limités par la nature computationnelle des modèles.
arXiv cs.AI · cs.LG · cs.CL·James Mickens·2 septembre 2026
Lu et jugé par Fellow · impact notable
Un papier théorique solide qui remet en cause la fiabilité des méthodes de sécurité basées sur l'auto-analyse linguistique (CoT) et propose des solutions concrètes comme le taint tracking.

Image · Source originale
Ce concept d'illisibilité linguistique désigne l'écart entre les calculs internes d'un LLM et ses sorties textuelles. Les méthodes de sécurité reposant sur l'auto-analyse linguistique (Chain-of-Thought, probing) sont donc incomplètes. Les auteurs préconisent des solutions d'isolation système comme le taint tracking.