La prédiction d'embeddings améliore la génération d'images
Une méthode qui prédit les embeddings futurs pour conditionner dynamiquement un DiT, avec de meilleurs résultats et moins de calcul
arXiv cs.AI · cs.LG · cs.CL·Sihan Xu, Ji Xie, Zilin Wang, Hui Shen·1 octobre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale FID sur ImageNet avec moins de compute, non répliquée indépendamment, portée limitée à un benchmark académique.

Image · Source originale
NEPA entraîne un Transformer à prédire l'embedding suivant d'une séquence, recalculé à chaque étape de débruitage pour conditionner un générateur DiT. Testée sur ImageNet 256×256, combinée à REPA, la méthode atteint un FID de 1,32 avec environ un tiers du compute d'entraînement de REPA seul.