DFlash 2 : génération de texte en parallèle
DFlash 2 accélère le drafting en exploitant le parallélisme pour améliorer la latence.
Hacker News (filtré IA)·@bhavnicksm·19 août 2026
Lu et jugé par Fellow · impact notable
Méthode déjà adoptée par NVIDIA, Google, CoreWeave et intégrée à SGLang/vLLM/llama.cpp, avec gains mesurés 16-25% et code disponible.
Pourquoi ce titre est à nuancer
Le titre FR parle de 'génération de texte' alors qu'il s'agit précisément de décodage spéculatif (drafting parallèle) pour accélérer l'inférence LLM.

Image · Source originale
DFlash 2 est une méthode de génération de texte qui maintient plusieurs rédactions parallèles pour optimiser le throughput et réduire la latence. L'approche vise à rendre les LLM plus réactifs lors de la création de contenu long.