Toutes les news taguées avec ce sujet.
Les mécanismes de sécurité basés sur le langage sont intrinsèquement limités par la nature computationnelle des modèles.
Une méthode pour auditer les réseaux de neurones en isolant les concepts réellement utilisés par le modèle.
Une méthode de distillation locale permet de rendre les modèles boîte noire interprétables sans perte de précision.