RECHERCHE
Windowed-MTP : supprimer le surcoût de KV cache complet du draft à un million de tokens
Une fenêtre glissante appliquée uniquement au module de prédiction multi-token accélère le décodage spéculatif sans perte de qualité sur des contextes massifs.
arXiv cs.AI · cs.LG · cs.CL·Alagappan Valliappan·23 juillet 2026

Image · Source originale
Les modèles frontières intègrent des têtes de prédiction multi-token (MTP) pour le décodage spéculatif, mais celles-ci recalculent l'attention complète sur tout le cache KV à chaque étape, ce qui devient dominant à un million de tokens de contexte. Les auteurs proposent Windowed-MTP, une fenêtre glissante de type StreamingLLM appliquée uniquement au draft, sans toucher à la vérification en attention complète, garantissant l'absence de perte de qualité. La méthode réduit de 99% les entrées KV du draft à 1M de tokens et diminue le coût par étape de décodage de 28% à 44% sur trois familles d'architectures.