CanvasAnneal : apprentissage par renforcement à curriculum pour modèles de langage à diffusion
Une méthode injecte des traces de raisonnement d'un modèle enseignant pour débloquer l'exploration en RL sur les modèles de diffusion.
arXiv cs.AI · cs.LG · cs.CL·Blake Olson, Yuhang Song, Emmett McQuinn, Yuan Shangguan·11 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'une méthode RL pour modèles de diffusion, gains task-dependent, non évalués indépendamment.

Image · Source originale
Les modèles de langage à diffusion peinent en raisonnement complexe face aux modèles autorégressifs, notamment à cause d'un goulot d'étranglement dans l'exploration lors du RL. CanvasAnneal injecte au départ des traces de raisonnement d'un modèle enseignant plus fort, puis retire progressivement ce guidage pendant l'entraînement. La méthode améliore les performances sur MATH500, Countdown et Tau2 par rapport à diffu-GRPO, avec une convergence accélérée sur les tâches les plus difficiles.