Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste la capacité d'agents IA à découvrir des features interprétables via des autoencodeurs épars, sans atteindre le niveau expert.
Une étude montre que les encodeurs visuels retiennent l'information de couleur typique même sur des images en niveaux de gris, révélant un lien conceptuel avec l'identité des objets.
Un projet open source permet d'observer comment un LLM répartit son attention entre les tokens d'un texte.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
Un thread suggère que les LLM encoderaient des structures proches de la logique symbolique, malgré une architecture purement statistique.
Une étude distingue comportements trompeurs et mécanismes internes pour évaluer la déception des modèles.
Une étude montre que les LLM-juges ne détectent que partiellement les étapes de raisonnement réellement décisives pour la réponse finale.
Une étude explore comment des structures symboliques apparaissent spontanément dans les représentations internes des réseaux de neurones.
Une étude formelle montre qu'un modèle de monde de code validé par un test peut être exact partout où le test regarde, et arbitrairement faux ailleurs.
Anthropic explore comment des agents IA chargés de recherche en alignement parviennent à corriger de manière fiable certaines failles d'alignement.
Une étude par sondes linéaires révèle une géométrie morale partagée dans les LLM, mais aucune trace de la distinction individualisant/liant prédite par la théorie
CAST utilise des autoencodeurs épars pour détecter et supprimer les artefacts de notes médicales, rendant les prédictions de mortalité plus robustes et traçables.
Analyse lexicale révélant les mots dont dépend le raisonnement du modèle.
Une bonne réponse ne garantit pas un calcul valide : ce papier propose un cadre pour auditer le raisonnement des agents LLM sur données structurées.
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
Un framework qui organise les prévisions multivariées autour de concepts lisibles générés par LLM, sans annotation manuelle coûteuse.
Une étude montre que l'effet d'un prompt dépend de la structure interne du modèle, mais qu'aucun facteur explicatif testé ne parvient à en rendre compte.
Une étude explore la capacité de modèles de langage de petite taille, type Qwen, à rendre compte de leurs propres états internes.
Une nouvelle représentation géométrique rend les explications contrefactuelles exactes et vérifiables pour les modèles de gradient boosting sur données tabulaires.
Un nouveau cadre surveille les échanges secrets entre agents LLM dans leurs états latents, invisibles dans les transcriptions publiques.
Un modèle de deep learning traduit les prévisions de circulation atmosphérique en estimations de précipitations, avec explication physique à l'appui.
Une thèse théorique propose un second paramètre linguistique, la phase, absent des transformers actuels et clé pour comprendre allusion, ironie et citation.
Des chercheurs montrent que des signaux discrets dans un prompt, combinés, orientent puissamment les réponses des modèles — y compris les modèles de raisonnement les plus avancés.
Une étude révèle que les détecteurs de conformité des LLM ignorent souvent la règle elle-même, un phénomène nommé « cécité aux règles ».
Une étude explore comment faire porter au texte généré une preuve vérifiable de l'état interne du modèle qui l'a produit.
Une méthode combine correction de raisonnement et détection d'incertitude en un seul passage forward, sans double calcul ni ré-entraînement du modèle.
Une nouvelle méthode évalue l'influence des exemples d'entraînement sans cible de validation, révélant une bascule littérature vers STEM au fil du pré-entraînement.
Un nouveau framework injecte des directions de décodeur SAE dans un LLM pour produire directement des explications en langage naturel des features apprises.
Analyse de 144 papiers du workshop TrustNLP révèle une bascule vers la véracité et l'alignement sécuritaire des modèles génératifs.
Une étude explore la capacité des LLM à détecter et rapporter des états internes injectés, signe d'une introspection émergente.