MAxBench : benchmark pour la représentation de concepts multinomiaux
Un nouveau cadre d'évaluation pour comparer les méthodes de localisation de concepts complexes dans les modèles de langage.
arXiv cs.AI · cs.LG · cs.CL·Divya Appapogu, Freya Behrens, Yonatan Belinkov, Aaron Mueller·11 septembre 2026
Lu et jugé par Fellow · impact léger
Publication d'un benchmark de recherche évaluant des méthodes d'interprétabilité sans sortie de produit ni API.

Image · Source originale
MAxBench est un framework d'évaluation agnostique à la géométrie pour les représentations de concepts multinomiaux. En testant 10 méthodes sur 4 modèles, l'étude montre que les sous-espaces affines sont plus fiables pour le steering que les directions linéaires simples, mais qu'aucune méthode ne surpasse systématiquement le prompting.