RECHERCHE
Copier moins, ancrer plus : corriger la copie répétitive dans le raisonnement long-contexte via un RL sensible aux preuves
Une étude identifie un défaut fréquent des LLM en contexte long : recopier le texte source au lieu de raisonner, et propose une méthode de RL pour y remédier.
arXiv cs.AI · cs.LG · cs.CL·Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang·21 juillet 2026

Image · Source originale
Les chercheurs montrent que les LLM en contexte long tendent à copier massivement le texte source dans leurs traces de raisonnement plutôt que de résoudre le problème, un défaut qui s'aggrave avec la longueur du contexte. La cause identifiée est un manque d'ancrage sur les preuves pertinentes. La méthode proposée, GEAR, ajoute une récompense d'ancrage et une pénalité pour les distracteurs, améliorant les performances jusqu'à +4,6 points en moyenne tout en réduisant la copie répétitive.