SAEVerbalizer : générer des explications des features d'autoencodeurs épars par verbalisation des représentations
Un nouveau framework injecte des directions de décodeur SAE dans un LLM pour produire directement des explications en langage naturel des features apprises.
arXiv cs.AI · cs.LG · cs.CL·Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu·13 août 2026

Image · Source originale
Les autoencodeurs épars (SAE) extraient de nombreuses features des représentations des LLM, mais leur interprétation repose sur l'observation externe du comportement du modèle, ce qui reste superficiel et coûteux. SAEVerbalizer injecte les directions du décodeur SAE dans les représentations d'un LLM et fine-tune ses couches pour générer des explications directement à partir de ces directions. La capacité de verbalisation généralise à des features inédites, transfère entre dictionnaires SAE distincts et, via un adaptateur léger, s'étend à des SAE issus d'autres LLM.