CLEAR : un routage d'adaptateurs latents pour aligner la sécurité des LLM sans sacrifier l'utilité
Une méthode de fine-tuning conditionnel réduit fortement les réponses nuisibles tout en préservant les performances sur les tâches bénignes.
arXiv cs.AI · cs.LG · cs.CL·Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo·21 août 2026
Lu et jugé par Fellow · impact léger
Résultats sur benchmarks propres à un seul modèle, sans évaluation indépendante ni déploiement.

Image · Source originale
CLEAR utilise un mécanisme de gating sur l'état caché pour moduler dynamiquement l'activation d'un adaptateur LoRA de sécurité, évitant les modifications globales du modèle. Sur Llama-3-8B-Instruct, le taux de réussite d'attaques HarmBench chute de 32,3% à 0,5%, avec un gain allant jusqu'à 7,1 points sur GSM8K comparé au SFT ou LoRA classiques.