RECHERCHE
OR Else : une région de confiance différentiable pour l'optimisation de politique
Une alternative lisse au clipping de PPO et GRPO testée sur Llama-3.2-1B pour le post-entraînement de LLM par RLHF.
arXiv cs.AI · cs.LG · cs.CL·Chinmay Rane, Kanishka Tyagi, Michael Manry·20 juillet 2026

Image · Source originale
Les chercheurs proposent Output Reset (OR), une règle de saturation lisse à sens unique remplaçant l'objectif clippé de PPO et GRPO. Testée sur Llama-3.2-1B-Instruct avec Anthropic hh-rlhf, PPO-OR améliore le score du reward model par rapport à PPO-clip sous GAE, tandis que GRPO-OR réduit la variabilité sans améliorer le score moyen sous avantages group-relative.