Toutes les news taguées avec ce sujet.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Une exploration technique de l'analyse des états internes d'un LLM pour comprendre son processus de raisonnement avant génération.
Des préfixes continus appris peuvent faire basculer les réponses correctes de plusieurs LLM sur des tâches de raisonnement syllogistique, révélant des failles de stabilité logique.
Une méthode pour empêcher les LLM alignés de céder à la pression sociale tout en restant sensibles aux preuves réelles
Des chercheurs modélisent l'apprentissage des circuits de raisonnement inductif via une variété invariante de faible dimension, rendant leur dynamique interprétable.
Une nouvelle méthode révèle que les modèles Mamba réallouent dynamiquement leurs modes d'état selon l'entrée, ouvrant la voie à un élagage plus efficace.
Une méthode sans entraînement cible des neurones précis de l'encodeur audio pour mieux capter émotion et intonation, sans toucher au modèle de langage.
Des chercheurs en interprétabilité mécaniste empruntent des outils de la théorie de la causalité pour décrypter les mécanismes internes des grands modèles de langage.
Un développeur indépendant publie Lucid, un outil qui expose et rend éditables les étapes de réflexion d'un modèle d'IA avant qu'il génère sa réponse.
Une nouvelle technique d'interprétabilité, le « J-lens », révèle un espace interne dans Claude Opus 4.6 où les intentions du modèle précèdent ses sorties.
Une étude sur les modèles Bielik montre que la dispersion des activations MLP prédit la familiarité d'un modèle avec une entité à AUROC 0,95-1,00, avant même la génération d'un token.
Un framework embarqué convertit une photo smartphone d'ECG papier en signal 12 dérivations et détecte l'infarctus du myocarde en moins de 30 secondes sur CPU.
Une étude de Transformer Circuits révèle que les LLM développent une structure analogue au « Global Workspace » théorisé en neurosciences cognitives.
Anthropic explore si les LLM développent une structure analogue à l'espace de travail global théorisé en neurosciences cognitives.
Des chercheurs proposent une méthode sans entraînement pour identifier et neutraliser les composants de CLIP responsables de la vulnérabilité aux attaques typographiques.
Une étude évalue dans quelle mesure les analyses d'interprétabilité réalisées sur des modèles open-weights sont transférables aux modèles propriétaires à accès restreint.
Des chercheurs proposent SemRF, un formalisme à ancres pour mesurer stablement l'évolution des représentations couche par couche dans les modèles de langage.
Une nouvelle méthode de régularisation combat le fractionnement et l'absorption de features dans les SAEs, deux pathologies qui nuisent à l'interprétabilité des LLMs.
Une étude mécanistique révèle qu'un petit groupe de têtes d'attention (2,5–4,8 %) contrôle la résolution des conflits entre vision et connaissance mémorisée dans les modèles multimodaux.
Des réseaux de neurones guidés par les symétries SU(3) et SU(4) de la physique nucléaire atteignent des performances compétitives tout en révélant la physique sous-jacente.
Deux régulariseurs de sparsité améliorent la monosémantique des SAEs Top-k sans dégradation de reconstruction, ouvrant la voie à une meilleure interprétabilité des modèles de vision.
Microsoft Research présente GCT, une méthode qui traduit les prédictions cérébrales des LLM en explications verbales vérifiables par expérience.
Un protocole d'investigation propose d'aller au-delà de la détection de comportements suspects pour établir si un modèle d'IA est réellement mal aligné.
Une méthode basée sur les gradients couche par couche permet de prédire les hallucinations des LLMs dès un seul passage forward-backward.
Un cadre de décision clinique qui combine PHQ-9, GAD-7, évaluation cognitive et profilage de la personnalité pour des classifications interprétables.