Quelle politique d'éviction pour un cache LLM ? Une étude systématique
Une comparaison rigoureuse de sept politiques d'éviction de cache sémantique révèle que LFU domine, mais que le vrai problème est ailleurs.
arXiv cs.AI · cs.LG · cs.CL·Yash Kulkarni, Shubham Harkare, Arvind Suresh Yogesh Babu·20 août 2026
Lu et jugé par Fellow · impact léger
Étude académique optimisant les caches LLM : gains de performance minimes (moins de 0,041 point) et problème d'efficacité réel (2,2% hits utiles) identifié.

Image · Source originale
L'étude compare FIFO, LRU, LFU, ARC, GDSF et d'autres politiques d'éviction pour caches sémantiques LLM sur trois corpus et deux encodeurs. LFU s'impose comme référence simple, aucune politique ne le surpassant de plus de 0,041 point. Un audit plus large révèle un problème majeur : au seuil médian de MiniLM, seulement 2,1 à 3,9% des hits sont réellement substituables, ramenant des taux de hit bruts de 51-60% à des taux ajustés de 1,1-2,2%.