ConvMem : une mémoire convolutionnelle pour le raisonnement en contexte long
Un nouveau cadre sans entraînement transforme le traitement du contexte long en convolution hiérarchique, réduisant latence et risque de surapprentissage.
arXiv cs.AI · cs.LG · cs.CL·Hongming Zhang, Zhaozhen Gu, Fengshuo Bai, Ming Hao·9 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche proposant une méthode incrémentale pour l'efficacité, sans librairie ni déploiement concret.

Image · Source originale
ConvMem reformule le raisonnement en contexte long comme une convolution hiérarchique, où un LLM sert de noyau résumant des segments de texte de façon arborescente plutôt que linéaire. Grâce aux strides configurables, connexions résiduelles et convolution multi-noyaux, la méthode limite l'accumulation d'erreurs et permet une forte parallélisation. Sans entraînement par RL, elle surpasse les baselines existantes sur RULER-HotpotQA et RULER-2WikiMultiHopQA tout en évitant le surapprentissage.