Apprendre à faire confiance sélectivement au contexte via un DPO adapté
Un benchmark et une méthode d'entraînement pour distinguer les modèles qui ignorent aveuglément le contexte de ceux qui savent vraiment quand s'y fier.
arXiv cs.AI · cs.LG · cs.CL·Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu·6 août 2026

Image · Source originale
Les auteurs introduisent MIST, un benchmark testant les modèles sous quatre conditions (contexte propre, trompeur, correct, non pertinent), et SC2W, une métrique mesurant la susceptibilité aux signaux trompeurs. Ils montrent que cette vulnérabilité est universelle chez les modèles testés. Leur méthode SCOPE, basée sur du Direct Preference Optimization équilibré sur les quatre conditions, réduit cette susceptibilité tout en préservant la précision.