RP-OPSD : self-distillation guidée pour le raisonnement multilingue
Une méthode de self-distillation on-policy qui se concentre sur les pivots de raisonnement pour améliorer le transfert de compétences multilingue des LLM.
arXiv cs.AI · cs.LG · cs.CL·Xinye Wang, Junxiao Liu, Shujian Huang·6 août 2026

Image · Source originale
RP-OPSD est une méthode de self-distillation qui cible les « pivots de raisonnement », des décisions clés orientant le processus d'inférence, plutôt que le texte de surface. Exploitant le décalage distributionnel avec des solutions de référence en anglais, elle priorise la supervision sur les tokens de contrôle du raisonnement. Les expériences sur des benchmarks mathématiques en 17 langues démontrent sa supériorité par rapport aux approches existantes.