Toutes les news taguées avec ce sujet.
Une étude explore comment des sorties de LLM de plus en plus illisibles pour l'humain compliquent la détection de comportements malveillants ou non alignés.
Une méthode de recherche montre qu'un unique prompt suffirait à retirer l'alignement de sécurité d'un LLM, sans données annotées.