Toutes les news taguées avec ce sujet.
Une étude formalise le coût en tokens de la détection, de l'attribution et de l'extraction pour les watermarks de textes générés par IA.
Une étude teste si les scores d'attribution identifient vraiment les neurones causalement importants dans les LLMs, notamment pour le comportement de refus.
Une étude évalue dans quelle mesure les analyses d'interprétabilité réalisées sur des modèles open-weights sont transférables aux modèles propriétaires à accès restreint.