WUSH-KV : quantification du KV cache par transformées adaptatives aux données
Une nouvelle méthode réduit l'empreinte mémoire du KV cache en LLM tout en limitant la perte de précision, même à 2 bits.
arXiv cs.AI · cs.LG · cs.CL·Jiale Chen, Vage Egiazarian, Eldar Kurtić, Torsten Hoefler·29 septembre 2026

Image · Source originale
WUSH-KV applique des transformées data-aware, calculées à partir de statistiques du second ordre, pour quantifier séparément les clés et valeurs du KV cache. Intégrée à SGLang, la méthode réduit l'erreur de reconstruction couche par couche et égale ou dépasse la transformée OSCAR à 2 bits sur plusieurs modèles et tâches.