Extraction des modèles implicites de l'utilisateur par auto-distillation des croyances
Une nouvelle méthode révèle comment les LLM se forgent une représentation de l'utilisateur, et montre que cette croyance influence directement leurs refus.
arXiv cs.AI · cs.LG · cs.CL·Ali Holmov, Yiran Huang, Kirill Bykov, Zeynep Akata·25 septembre 2026
Lu et jugé par Fellow · impact notable
Recherche interprétabilité vérifiable montrant que le refus dépend de croyances internes manipulables sur l'utilisateur, avec implications sécurité concrètes.

Image · Source originale
Des chercheurs présentent Belief Self-Distillation (BSD), un cadre qui permet de décoder et de réécrire la représentation interne qu'un LLM se fait de son utilisateur. L'étude montre que le refus d'un modèle dépend non seulement de la requête mais aussi de l'intention supposée de l'utilisateur, et que différents modèles convergent vers une géométrie similaire pour représenter cette croyance. Ces résultats ont des implications directes pour la sécurité des IA.