Copier l'identique, distiller la différence : comment initialiser les Vision Transformers linéaires
Une étude montre que les poids MLP des ViT Softmax se transfèrent tels quels vers les ViT linéaires, tandis que l'attention doit être distillée pour combler l'écart de performance.
arXiv cs.AI · cs.LG · cs.CL·Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Shiqi Huang·28 septembre 2026
Lu et jugé par Fellow · impact léger
Résultat technique incrémental sur l'initialisation de ViT linéaires, sans preprint évalué indépendamment ni déploiement.

Image · Source originale
Les chercheurs examinent comment initialiser efficacement les Vision Transformers à attention linéaire à partir de modèles Softmax pré-entraînés. Ils montrent que copier directement les poids d'attention n'apporte rien, voire nuit, car ces poids sont spécifiques à l'opérateur. En revanche, les poids MLP se transfèrent sans perte, et une distillation ciblée de l'attention permet aux ViT linéaires d'égaler, voire de surpasser, les versions Softmax.