SafeEvolve : co-évolution harness-politique à partir de l'expérience des agents pour l'alignement de sécurité
Un nouveau cadre fait évoluer conjointement l'environnement d'exécution et la politique des agents LLM pour réduire les comportements dangereux.
arXiv cs.AI · cs.LG · cs.CL·Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan·2 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche avec benchmark et résultats chiffrés, mais gains incrémentaux sur un seul modèle et non couvert par la communauté.

Image · Source originale
SafeEvolve exploite les trajectoires d'agents déjà exécutées pour faire évoluer à la fois le harness (prompts de sécurité, compétences hiérarchiques) et la politique via un pipeline SFT puis RL. L'approche vise à combiner contrôle runtime et sécurité intrinsèque du modèle. Sur des benchmarks de sécurité agentique, elle obtient un meilleur compromis sécurité-utilité que les baselines existantes, avec une réduction du taux de succès d'attaque (ASR) d'un facteur 3 pour Qwen3.5-4B.