ConceptGuard : un benchmark pour évaluer l'unlearning sensible au contexte dans les LLM
Un nouveau benchmark teste la capacité des LLM à oublier des usages nuisibles d'un concept sans perdre ses usages légitimes.
arXiv cs.AI · cs.LG · cs.CL·Sahil Kale, Ian Harris·20 août 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark académique sur l'unlearning conceptuel, non repris ni évalué indépendamment au-delà de l'article source.

Image · Source originale
Les méthodes actuelles d'unlearning évaluent l'oubli sur des faits isolés, sans distinguer usages bénéfiques et malveillants d'un même concept. Les auteurs introduisent la notion de concepts à double usage et proposent ConceptGuard, un benchmark où les ensembles à oublier et à retenir se recouvrent au niveau conceptuel. Les techniques existantes montrent une séparation contextuelle faible et de mauvaises performances sur les métriques ROUGE et conceptuelles.