RECHERCHE
Faut-il vraiment pré-entraîner les Q-fonctions pour le RL online ?
L'étude remet en cause l'intérêt du pré-entraînement des Q-fonctions lors du fine-tuning online en RL.
arXiv cs.AI · cs.LG · cs.CL·Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Fin·29 juillet 2026

Image · Source originale
Ce papier analyse si le pré-entraînement des Q-fonctions est nécessaire lors du fine-tuning online de politiques pré-entraînées. Les résultats montrent un décalage fondamental avec l'apprentissage online, rendant cette approche peu bénéfique par rapport à l'initialisation aléatoire. Les auteurs proposent IPE, une méthode d'initialisation par ensemble de politiques qui améliore les performances de 26% sur les benchmarks.