BLOOM-WILT : une méthode d'audit automatisé pour révéler les comportements rares des LLM
Un nouveau pipeline d'audit multi-tours détecte des comportements problématiques rares chez les LLM sans entraînement ni accès privilégié au modèle.
arXiv cs.AI · cs.LG · cs.CL·Adrians Skapars, Edoardo Manino·31 août 2026
Lu et jugé par Fellow · impact notable
Méthode d'audit reproductible testée sur 4 modèles/8 comportements, surpasse la baseline dans 30/32 cas, résultats vérifiables mais recherche méthodologique sans déploiement.

Image · Source originale
BLOOM-WILT est un pipeline d'audit automatisé qui provoque des comportements rares chez les LLM en conditions conversationnelles réalistes, sans coût d'entraînement. La méthode ajuste la stratégie de l'auditeur au fil des échanges et repondère le décodage du modèle cible via sa propre distribution conditionnée. Testée sur 4 modèles et 8 comportements, elle surpasse la baseline dans 30 cas sur 32 et bouleverse les classements de sécurité établis, portant par exemple le taux d'élicitation d'encouragements à l'automutilation de 51% à 100% sur Qwen3.5-4B.