RECHERCHE
ResKV : reconstruire les contributions d'attention omises pour la compression du cache KV à budget fixe
Une méthode qui combine cache principal exact et cache résiduel compact pour limiter les pertes d'information lors de la compression du KV cache en contexte long.
arXiv cs.AI · cs.LG · cs.CL·Yuhang Zhan, Lisi Chen, Shuo Shang·31 juillet 2026

Image · Source originale
Les méthodes d'éviction du KV cache suppriment définitivement des tokens et perdent leur contribution à l'attention, tandis que les approches par fusion risquent de perturber les clés/valeurs conservées. ResKV divise un budget KV fixe en un cache principal exact et un cache résiduel qui reconstruit la contribution des tokens omis via la normalisation softmax. Un proxy de validation à la construction alloue les ressources résiduelles par couche et tête, complété par une porte dynamique au moment du décodage. Les tests sur LongBench et RULER montrent des gains constants à budget KV égal, sans dégrader la mémoire ni le débit.