Looped Diffusion Transformer : boucler les blocs pour gagner en profondeur de calcul
Une nouvelle architecture fait tourner les mêmes blocs Transformer plusieurs fois par étape de diffusion, surpassant des modèles 6,5x plus gros à compute réduit.
arXiv cs.AI · cs.LG · cs.CL·Yong Xien Chng, Tianyi Chen, Wenwen Tong, Haiwen Diao·30 septembre 2026

Image · Source originale
Looped-DiT réutilise des blocs Transformer partagés de façon itérative au sein de chaque étape de denoising, augmentant la profondeur de calcul sans ajouter de paramètres. Grâce à une supervision profonde et une attention auto-modulante, un modèle de 260M de paramètres bouclé dépasse un modèle 6,5x plus grand sur plusieurs benchmarks text-to-image, avec 4,9x moins de compute d'inférence.