Memory Attention : remplacer la projection de valeur par une mémoire indexée par token
Une nouvelle architecture d'attention qui combine une mémoire token-spécifique aux clés contextuelles, réduisant l'inférence à une simple recherche et addition tout en améliorant les performances.
arXiv cs.AI · cs.LG · cs.CL·Jiale Kang·23 septembre 2026
Lu et jugé par Fellow · impact léger
Proposition architecturale incrémentale (remplacement de la projection de valeur par recherche table) avec gains expérimentaux, mais sans validation indépendante ni modèle déployé.

Image · Source originale
Les LLM calculent l'attention via des états cachés contextuels, bien que certains contenus soient réutilisables. Memory Attention (MA) remplace la projection de valeur par une mémoire indexée par token, combinée aux clés contextuelles. À l'inférence, la normalisation est intégrée aux tables de mémoire, réduisant le calcul à une recherche et addition. Le déchargement CPU avec préchargement diminue le stockage GPU. Les expériences montrent une amélioration du langage et des tâches aval.