RECHERCHE
Relay-OPD : une méthode de distillation on-policy qui corrige les trajectoires de raisonnement défaillantes
Un nouveau mécanisme de relais enseignant-élève réduit l'échec en cascade lors de la distillation, avec des gains mesurables sur le raisonnement mathématique.
arXiv cs.AI · cs.LG · cs.CL·Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni·28 juillet 2026

Image · Source originale
Les chercheurs identifient une asymétrie entre enseignant et élève lorsque ce dernier s'engage sur une mauvaise direction de raisonnement. Relay-OPD exploite cette asymétrie comme déclencheur pour faire intervenir brièvement l'enseignant avant de rendre la main à l'élève. Testée avec Qwen3, la méthode dépasse l'OPD standard de +5,73% et réduit la longueur des trajectoires d'entraînement de plus de 50%.