ERPO : optimisation de politique pour le code à l'exécution
Une méthode de reinforcement learning test-time exploitant des probes exécutables pour améliorer les modèles de code.
arXiv cs.AI · cs.LG · cs.CL·Jiacheng Xu, Feng Chen, Xiuneng Xu, Bo An·8 septembre 2026
Lu et jugé par Fellow · impact léger
Méthode incrémentale accepté à EMNLP 2026, gains reportés uniquement sur benchmarks internes sans comparaison indépendante.

Image · Source originale
Cette étude introduit ERPO, une approche de test-time reinforcement learning pour la génération de code. Elle utilise des sondes sans sortie et un consensus comportemental pour générer des récompenses, atténuant les dérives de politique et le reward hacking. Les résultats montrent des gains significatifs en pass@1 et pass@k sur les benchmarks de code.