Toutes les news taguées avec ce sujet.
Une méthode de quantification spatio-temporelle réduit jusqu'à 68,7% la mémoire de serving tout en préservant la précision proche du FP32.
Un patch d'agent de codage IA peut réussir tous les tests mais échouer une fois le modèle chargé et confronté à de vraies requêtes.
Zhipu AI détaille l'architecture technique développée en interne pour servir efficacement ses modèles GLM à grande échelle.
vLLM ajoute le support du décodage spéculatif pour les GPU AMD, promettant une accélération de l'inférence LLM sur cette plateforme.