Toutes les news taguées avec ce sujet.
Une exploration technique de l'analyse des états internes d'un LLM pour comprendre son processus de raisonnement avant génération.
Une analyse des états cachés révèle la structure géométrique des biais de notation chez les LLM-juges.
Analyse des travaux d'Anthropic en interprétabilité mécaniste et de leurs réelles implications pour la compréhension des LLM.
Des chercheurs en interprétabilité mécaniste empruntent des outils de la théorie de la causalité pour décrypter les mécanismes internes des grands modèles de langage.
Une nouvelle technique d'interprétabilité, le « J-lens », révèle un espace interne dans Claude Opus 4.6 où les intentions du modèle précèdent ses sorties.
Une étude de Transformer Circuits révèle que les LLM développent une structure analogue au « Global Workspace » théorisé en neurosciences cognitives.
Une étude évalue dans quelle mesure les analyses d'interprétabilité réalisées sur des modèles open-weights sont transférables aux modèles propriétaires à accès restreint.