Quand et où faire confiance à l'enseignant : unifier distillation on-policy et GRPO via attribution de crédit calibrée par l'entropie
Une nouvelle méthode combine signaux du vérificateur et du modèle enseignant dans GRPO pour affiner l'apprentissage du raisonnement mathématique token par token.
arXiv cs.AI · cs.LG · cs.CL·Jie Zhang, Jingxiao Yang, Zhehao Huang, Yuhang Liu·23 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale (+0.56 à +0.89 pp) sur 5 benchmarks mathématiques pour une méthode unifiant GRPO et distillation.

Image · Source originale
UECR-GRPO fusionne récompense vérifiable et guidance d'un modèle enseignant dans une même mise à jour GRPO, aux niveaux réponse et token. La méthode redistribue le crédit selon l'écart enseignant-politique pondéré par l'entropie, tout en préservant le crédit total par réponse. Testée sur cinq benchmarks de raisonnement mathématique.