KV-streams : une méthode pour accélérer la compaction de contexte en RL agentique
Un nouveau mécanisme évite de reconstruire le cache KV à chaque compaction, avec un gain de vitesse d'entraînement jusqu'à 5x.
arXiv cs.AI · cs.LG · cs.CL·Emiliano Penaloza, Dane Malenfant, Dheeraj Vattikonda, Roger Creus Castanyer·28 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration technique d'efficacité d'entraînement (gain 2,6-5x) non vérifiée indépendamment, portée limitée aux pipelines RL agentiques.

Image · Source originale
Les LLM agentiques sont limités par la mémoire GPU nécessaire pour stocker de longs contextes. KV-streams propose de faire circuler le cache KV plutôt que de le vider à chaque compaction, ce qui accélère l'entraînement de 2,6 à 5x sans dégrader les performances. Les auteurs montrent aussi que ce cache streamé agit comme un état récurrent, conservant des informations disparues du contexte, un effet émergent du RL seul.