BPCO : une méthode stable pour entraîner des critics de LLM
BPCO stabilise l'entraînement des critics en RL, offrant une alternative fiable aux méthodes group-based comme GRPO.
arXiv cs.AI · cs.LG · cs.CL·Penghui Qi, Xiangxin Zhou, Wee Sun Lee·24 août 2026
Lu et jugé par Fellow · impact notable
Recette d'entraînement de critic validée par expériences contrôlées, égalant/surpassant GRPO avec un seul échantillon, mais résultats limités au raisonnement mathématique.

Image · Source originale
Les méthodes de Reinforcement Learning par groupe comme GRPO évitent l'entraînement d'un critic, souvent instable. Ce papier propose BPCO (Best-Practice Critic Optimization), une recette combinant DPPO, bornes de valeur et estimation GAI adaptative. Les expériences montrent que BPCO surpasse les baselines groupées sur des tâches de raisonnement mathématique, avec un seul échantillon par prompt.