Comment les modèles de langage organisent la connaissance morale
Une étude par sondes linéaires révèle une géométrie morale partagée dans les LLM, mais aucune trace de la distinction individualisant/liant prédite par la théorie
arXiv cs.AI · cs.LG · cs.CL·Orion Reblitz-Richardson·27 août 2026
Lu et jugé par Fellow · impact léger
Étude interprétabilité intéressante mais exploratoire, sur sondes linéaires, sans application concrète ni validation externe.

Image · Source originale
Des chercheurs entraînent six sondes linéaires sur des modèles open-weight, une par catégorie de la Moral Foundations Theory. Les directions morales ne fusionnent pas mais partagent une composante commune spécifique au moral, présente dès le début du pré-entraînement. Aucune preuve de la distinction individualisant/liant théorique ; la structure reflète plutôt les statistiques du corpus.