STEPQuant : quantifier les états récurrents des modèles à attention linéaire sans perte de précision
Une méthode de quantification spatio-temporelle réduit jusqu'à 68,7% la mémoire de serving tout en préservant la précision proche du FP32.
arXiv cs.AI · cs.LG · cs.CL·Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu·29 septembre 2026
Lu et jugé par Fellow · impact léger
Technique de quantification incrémentale pour l'attention linéaire, gains mémoire mesurés mais sans large validation indépendante ni déploiement établi.

Image · Source originale
STEPQuant s'attaque au goulot d'étranglement mémoire des états récurrents dans l'attention linéaire de type Delta-rule. La méthode alloue la précision selon l'ampleur des erreurs et la durée de vie en mémoire, en ajustant conjointement les échelles par ligne et colonne. Testée sur Qwen3.8-27B et Kimi-Linear-48B-A3B-Instruct, elle égale la précision FP32 à 6 bits et surpasse INT8 uniforme à 4 bits, avec une compression x5 intégrée à SGLang.