SPADE : un framework de self-play pour générer des environnements d'entraînement adaptatifs
Un même LLM conçoit et résout des environnements d'entraînement pour progresser en continu, sans pool de tâches figé.
arXiv cs.AI · cs.LG · cs.CL·Bo Liu, Simon Yu, Yiding Jiang, Ao Qu·19 août 2026
Lu et jugé par Fellow · impact notable
Papier de recherche avec code et benchmarks précis (+5.3 sur 8 tests) validant une méthode d'entraînement adaptatif.

Image · Source originale
SPADE fait jouer un seul LLM à deux rôles : concepteur d'environnements exécutables et agent qui apprend à y évoluer. Le concepteur cible des tâches proches des limites de l'agent en optimisant un signal de regret, ce qui améliore les performances sur des modèles jusqu'à 30B paramètres, avec un gain moyen de +5.3 sur huit benchmarks de math, science, code et raisonnement.