SCAPO : une variante de GRPO pour réduire la sensibilité des LLM aux détails non pertinents du prompt
Une méthode d'attribution de crédit au niveau des tokens améliore la robustesse du raisonnement des LLM entraînés par RLVR.
arXiv cs.AI · cs.LG · cs.CL·Junshu Pan, Zhizhang Fu, Shulin Huang, Yiran Ding·30 septembre 2026

Image · Source originale
Les chercheurs montrent que les LLM entraînés par RLVR restent sensibles à des variations de prompt qui ne changent ni le problème ni la réponse attendue. Ils proposent SCAPO, une variante de GRPO qui pénalise les tokens instables lors de l'attribution de crédit en début d'entraînement. Sur Qwen3-4B-Base et Qwen3-1.7B-Base, SCAPO améliore la précision sur AIME 2024-2026 de respectivement 5,63 et 4,17 points par rapport à GRPO.