Flash-dLLM : cache KV optimisé pour l'I/O et décodage parallèle pour des LLMs de diffusion rapides
Un framework sans entraînement qui accélère les LLMs de diffusion en s'attaquant au goulot d'étranglement mémoire du cache KV.
arXiv cs.AI · cs.LG · cs.CL·Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen·22 septembre 2026
Lu et jugé par Fellow · impact notable
Résultats de recherche avec gains mesurés (5.1× et 11.0× speedups) sur des benchmarks publics, mais applicabilité restreinte aux dLLMs, encore émergents.

Image · Source originale
Flash-dLLM identifie les mouvements mémoire GPU comme principal frein aux LLMs de diffusion utilisant un cache KV, et propose un noyau fusionné optimisé pour l'I/O. Le modèle sert lui-même de générateur et de vérificateur dans un décodage draft-and-verify, sans modèle auxiliaire. Les tests sur des benchmarks de raisonnement mathématique et de génération de code montrent des gains en vitesse et en efficacité mémoire face aux méthodes existantes.