Toutes les news taguées avec ce sujet.
vLLM ajoute le support du décodage spéculatif pour les GPU AMD, promettant une accélération de l'inférence LLM sur cette plateforme.
Troisième volet d'une série sur le co-design de modèles IA, avec cinq règles pratiques pour choisir la longueur et le mécanisme de draft.
Cette méthode sans entraînement accélère les LLM via des arbres de candidats parallèles, dépassant les vitesses des approches classiques.