LeapQuant : quantification précise de l'état récurrent pour l'attention linéaire efficace
Une méthode sans entraînement permet de quantifier en 8 bits l'état récurrent des architectures à attention linéaire, sans perte notable de qualité.
arXiv cs.AI · cs.LG · cs.CL·Yi Pan, Haocheng Xi, Kan Zhu, Xingyang Li·29 septembre 2026
Lu et jugé par Fellow · impact léger
Gain d'efficacité technique mesuré (2-3.7x kernel, 1.47x end-to-end) mais méthode d'optimisation incrémentale sans changement de capacité pour les utilisateurs.

Image · Source originale
LeapQuant s'attaque au goulot d'étranglement de l'attention linéaire (GDN, KDA) en proposant une quantification par fenêtre et des « Compensator Tokens » pour préserver les valeurs aberrantes de l'état récurrent. Cette approche training-free réduit fortement la mémoire et le calcul à l'inférence tout en maintenant une précision proche du FP32, validée sur les familles Qwen, Kimi et GLM.