RECHERCHE
Skill Self-Play : l'auto-évolution des LLM par compétences co-évolutives
Un nouveau cadre d'entraînement par auto-jeu pour améliorer les capacités de raisonnement et d'usage d'outils des LLM.
arXiv cs.AI · cs.LG · cs.CL·Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen·24 juillet 2026

Image · Source originale
Skill Self-Play (Skill-SP) est un cadre co-évolutif composé d'un proposeur, d'un solveur et d'un contrôleur de compétences. Il vise à résoudre le dilemme entre diversité des tâches et fiabilité de la vérification lors de l'auto-évolution des LLM. Les évaluations montrent que cette méthode repoussent les limites de performance en raisonnement et utilisation d'outils.