RECHERCHE
PagedWeight : servir les LLM MoE efficacement grâce à une quantification dynamique adaptée à la qualité
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
arXiv cs.AI · cs.LG · cs.CL·Yuchen Yang, Yifan Zhao, Anisha Dasgupta, Sasa Misailovic·17 juillet 2026

Image · Source originale
PagedWeight propose une quantification dynamique des poids des modèles Mixture-of-Experts, ajustée en fonction du KV cache disponible. La méthode atteint une précision équivalente à FP16 tout en réduisant la mémoire GPU jusqu'à 72% et en améliorant le débit jusqu'à 1,94x. Elle surpasse les méthodes de quantification existantes de 39,3% à budget mémoire équivalent.