SAS : attention par épinglage optimisée end-to-end
Une méthode de sparsification de l'attention aligne directement le classement du contexte sur l'impact prédictif, sans bloquer les gradients.
arXiv cs.AI · cs.LG · cs.CL·Zhiwei Li, Lei Zhu, Hao Gu, Xiang Hu·11 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'une méthode de sparsification d'attention, sans évaluation indépendante ni déploiement concret.

Image · Source originale
SAS propose un mécanisme d'attention par épinglage (gated sparse attention) optimisé end-to-end pour réduire les coûdes des Transformers. Contrairement aux approches existantes qui utilisent une sélection Top-K bloquant les gradients, SAS injecte des scores continus dans les logits attentionnels. Cela permet une mise à jour directe du sélecteur via la perte de modélisation du langage, préservant les priorités relatives pour un meilleur usage du budget contextuel.