λ-Controlled GRPO : transformer l'instabilité du flow-matching en ressource budgetée
Une nouvelle méthode reformule l'instabilité inhérente aux modèles flow-matching comme une ressource mesurable et budgetée, surpassant les stabilisateurs ajustés à la main.
arXiv cs.AI · cs.LG · cs.CL·Yufeng Wang, Parivesh Priye, Meeshawn Marathe, Ramit Pahwa·18 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration technique incrémentale d'un stabilisateur RL pour flow-matching, validée sur un seul modèle text-to-image, sans évaluation indépendante.

Image · Source originale
L'alignement des générateurs d'images par RL sur des signaux de récompense souffre d'instabilités spécifiques au débruitage multi-étapes. Cette étude montre que ces instabilités découlent d'une unique quantité par étape, la variance de chemin, déterminée par le noyau de transition gaussien. La méthode λ-Controlled GRPO calibre les ratios d'importance via cette loi prédite et alloue l'effort de gradient selon le coût prévu, sans hyperparamètres libres. Sur des modèles text-to-image, cette approche surpasse les stabilisateurs manuels.