Une auto-rétrospection étonnamment simple améliore les modèles agentiques sans RL
Une méthode de fine-tuning basée uniquement sur des explications rétrospectives rivalise avec GRPO sur SWE-bench, sans reward ni verifier.
arXiv cs.AI · cs.LG · cs.CL·Jonathan Light, Christopher Zhang Cui, Jeonghye Kim, Roger Creus Castanyer·28 septembre 2026
Lu et jugé par Fellow · impact notable
Résultat vérifiable sur SWE-bench dépassant GRPO avec une méthode plus simple, mais un seul papier non répliqué.

Image · Source originale
Des chercheurs testent ROFT, une procédure où un agent LLM s'entraîne uniquement sur ses propres explications rétrospectives d'expériences passées, sans apprentissage par renforcement ni professeur externe. Sur Qwen3.5-4B et SWE-bench Verified/Pro, ROFT atteint 49,2% et 26,8% de réussite après 20 mises à jour, dépassant GRPO (48,0% et 25,3% après 40 mises à jour) et progressant plus vite. L'agent parvient même à résoudre des tâches où les 64 tentatives initiales avaient échoué.