Diffusibilité des latents en haute dimension : impact sur la génération par flow matching
Le fine-tuning des encodeurs visuels pour la reconstruction réduit la dimensionnalité effective des latents, rendant le flow matching sous-optimal. La prédiction x₀ résout ce problème.
arXiv cs.AI · cs.LG · cs.CL·Chao Feng, Zhiyang Xu, Bowei Chen, Yuanjun Xiong·23 septembre 2026
Lu et jugé par Fellow · impact notable
Article accepté à ECCV 2026 identifiant un défaut structurel du flow matching sur latents de RAE et proposant x₀-prediction comme solution vérifiée.

Image · Source originale
Les Representation Autoencoders (RAEs) permettent d'appliquer la diffusion dans l'espace de caractéristiques d'encodeurs visuels pré-entraînés. Cependant, le fine-tuning de ces encodeurs pour améliorer la reconstruction réduit la dimensionnalité effective de la représentation. Dans ce contexte, la prédiction de vélocité standard du flow matching s'avère inefficace car elle ajuste des directions de bruit orthogonales hors de la variété du signal. L'utilisation de la paramétrisation en données propres (x₀-prediction), qui concentre l'apprentissage sur la variété sous-jacente, améliore systématiquement les performances de génération text-to-image.