Apprendre la réflexion native dans les modèles unifiés via du RL entrelacé
Une méthode de RL entraîne conjointement diagnostic textuel et révision d'image pour que les modèles unifiés corrigent leurs propres générations.
arXiv cs.AI · cs.LG · cs.CL·Yijia Fan, Ziqi Huang, Zhongang Cai, Yan Li·28 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale mesurée sur un seul modèle (BAGEL) via benchmarks standards, sans code ni modèle publiés vérifiés.

Image · Source originale
UMM-Reflection applique du reinforcement learning sur des trajectoires complètes de réflexion au sein d'un modèle unifié, en attribuant un avantage au niveau de la trajectoire qui met à jour à la fois les tokens de réflexion et les révisions d'image. Testée sur BAGEL, la méthode améliore GenEval de 12,05 points par rapport au SFT, avec des gains transférables à WISE, OneIG-Bench et T2I-CompBench++, bien qu'aucun de ces benchmarks ne soit utilisé lors de l'entraînement.