RRC : unlocking generative reward models via ranking
Une méthode RRC aligne les reward models génératifs avec le RL pour de meilleurs signaux d'apprentissage.
arXiv cs.AI · cs.LG · cs.CL·Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li·6 août 2026

Image · Source originale
Les auteurs proposent RRC (Ranking-based Reward Construction) pour combler l'écart entre les modèles de récompense génératifs et les algorithmes de RL basés sur des scores scalaires. En exploitant des classements relatifs via des stratégies auto-compétitives et guidées par ancrage, RRC améliore significativement l'entraînement RL sur des benchmarks de dialogue et de raisonnement.