Que lisent vraiment les détecteurs de conformité ? Un audit des probes d'activation et des modèles de garde-fous
Une étude révèle que les détecteurs de conformité des LLM ignorent souvent la règle elle-même, un phénomène nommé « cécité aux règles ».
arXiv cs.AI · cs.LG · cs.CL·Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth·17 août 2026
Lu et jugé par Fellow · impact notable
Papier scientifique démontrant une faille (« cécité aux règles ») dans les détecteurs de conformité actuels, avec protocole et benchmark publiés.

Image · Source originale
Les auteurs montrent que les guard models et probes d'activation actuels détectent des violations de conformité sans réellement dépendre de la règle énoncée : supprimer, permuter ou remplacer la règle ne change pas leur verdict. Un benchmark dédié confirme cette faille, que seul un raisonnement étape par étape parvient à éviter. Les chercheurs introduisent l'Internal Compliance Score (ICS), un détecteur sans réentraînement, mais reconnaissent qu'il ne dépasse pas significativement un simple modèle bag-of-words.