Lisibilité n'est pas interprétabilité : importance jugée vs réelle dans le raisonnement chain-of-thought
Une étude montre que les LLM-juges ne détectent que partiellement les étapes de raisonnement réellement décisives pour la réponse finale.
arXiv cs.AI · cs.LG · cs.CL·Kevin Du, Alexander Hoyle, Laura Ruis, Acyr Locatelli·3 septembre 2026
Lu et jugé par Fellow · impact notable
Étude COLM 2026 avec méthode causale rigoureuse montrant que les juges LLM ne récupèrent que partiellement l'importance réelle des étapes de raisonnement.

Image · Source originale
Les chercheurs mesurent l'importance réelle d'une étape de raisonnement via son avantage causal (impact sur la probabilité de bonne réponse, estimé par rollouts Monte Carlo). Ils comparent cette référence aux jugements de LLM-juges censés évaluer la fidélité des traces chain-of-thought. Les modèles capables dépassent une base de prévalence mais restent loin d'un plafond de bruit ; même après fine-tuning en critique pas-à-pas, l'écart persiste pour les réponses correctes. Conclusion : la lisibilité textuelle d'un raisonnement ne garantit pas son interprétabilité, ce qui questionne l'usage des process reward models.