CoinRAG : réutilisation de cache KV pour le RAG long-contexte
Une méthode de réutilisation de cache fine-grained pour optimiser l'efficacité et la précision du RAG.
arXiv cs.AI · cs.LG · cs.CL·Gyuwan Kim, Cheoneum Park, Tao Yang·7 août 2026

Image · Source originale
CoinRAG optimise le Retrieval-Augmented Generation en réutilisant des caches KV de niveau 'nugget' plutôt que des chunks complets. Cette approche identifie les unités sémantiques pertinentes via une récupération en deux étapes pour réduire la latence et le bruit. Sur les benchmarks LongBench, elle améliore de 5,3 % la qualité des réponses tout en réduisant les coûts opérationnels.