De l'interprétabilité au contrôle : bilan de six ans d'ateliers TrustNLP
Analyse de 144 papiers du workshop TrustNLP révèle une bascule vers la véracité et l'alignement sécuritaire des modèles génératifs.
arXiv cs.AI · cs.LG · cs.CL·Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna·11 août 2026

Image · Source originale
Une synthèse des six éditions du workshop TrustNLP (2021-2026) montre une évolution de l'interprétabilité post-hoc vers la compréhension mécanistique et le contrôle proactif des systèmes génératifs. La véracité devient la dimension à la croissance la plus rapide (37% des papiers en 2025-2026), tandis que l'explicabilité connaît une trajectoire en U avec un regain via l'interprétabilité mécanistique.