Le "score centering" stabilise l'apprentissage par renforcement off-policy
Une correction additive corrige le biais de dérive entre moteurs d'entraînement et d'inférence, source d'instabilité du RL sur les LLM.
arXiv cs.AI · cs.LG · cs.CL·Martin Marek, Max Ryabinin·17 septembre 2026
Lu et jugé par Fellow · impact notable
Une méthode simple corrige l'instabilité de RL pour les LLM en annulant le biais de dérive, validée sur des modèles jusqu'à 30B.

Image · Source originale
Les chercheurs montrent que l'instabilité du RL causée par le décalage entraînement-inférence (TIM) vient surtout d'un biais de dérive cumulatif. Ils proposent une correction additive, le "score centering", qui annule cette dérive. Sur des modèles de 0,6B à 30B paramètres, cette méthode égale ou surpasse les approches par importance sampling sous quantification, et se combine avec elles pour de meilleurs résultats.