RetireOPD : auto-retraite pour distillation on-policy
Une méthode de distillation adaptative améliore les agents RL en désactivant le professeur une fois l'étudiant performant.
arXiv cs.AI · cs.LG · cs.CL·Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan·17 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale mesurée sur ALFWorld/WebShop avec Qwen2.5, sans validation indépendante ni couverture large.

Image · Source originale
RetireOPD optimise un agent via une distillation on-policy auto-régulée. Un enseignant conditionné par des compétences guide un étudiant, qui abandonne cette supervision une fois sa performance suffisante. Sur des modèles Qwen2.5, cette approche surpasse les baselines RL et l'enseignant lui-même sur ALFWorld et WebShop.