RECHERCHE
Éviction comme estimation : la mémoire à décalage fixe pour la gestion de la mémoire en test
Une nouvelle façon de penser la gestion de mémoire des LLM révèle les limites des méthodes existantes sur des benchmarks tiers indépendants.
arXiv cs.AI · cs.LG · cs.CL·Maruthi Vemula, Neeraj Praneeth Gajula·27 juillet 2026

Image · Source originale
Les auteurs proposent RMM, une politique de gestion de mémoire bornée pour LLM qui généralise H2O en observant, après un délai fixe, quels éléments une prédiction correcte a réellement utilisés. Si cette approche surpasse largement l'attention accumulée en environnement contrôlé, son avantage disparaît sur des benchmarks indépendants (KVPress) où elle égale H2O et perd face à SnapKV en configuration multi-tours.