EAServe : un service désagrégé et conscient de l'encodage pour les LLM multimodaux
Une nouvelle architecture repositionne l'étape d'Encode comme point de contrôle du pipeline Encode-Prefill-Decode pour les MLLM.
arXiv cs.AI · cs.LG · cs.CL·Kunxiong Zhu, Zhihao Shu, Hangyu Zheng, Minghai Qin·25 septembre 2026
Lu et jugé par Fellow · impact léger
Optimisation d'infrastructure de serving MLLM, gains mesurés (4.3x/1.7x goodput) mais accepté PACT 2026, portée technique restreinte à l'infra.

Image · Source originale
Les auteurs identifient un déséquilibre structurel dans le service des LLM multimodaux : l'étape d'Encode sous-utilise son GPU tout en freinant les étapes suivantes de Prefill et Decode. EAServe propose un runtime avec micro-batching adaptatif, offload partiel régulé et partitionnement dynamique des SM, ainsi qu'une couche de configuration (HAS) pour optimiser l'allocation GPU et les paramètres d'exécution.