Toutes les news taguées avec ce sujet.
Un développeur détaille son approche pour concevoir un petit modèle de langage optimisé pour l'exécution CPU, sans GPU.
NVIDIA détaille comment son CPU Vera vise à optimiser l'orchestration des workloads agentiques imprévisibles à l'échelle des data centers.
Georgi Gerganov publie la version initiale de llama.cpp, portant l'inférence LLM sur CPU.
Red Hat explore comment optimiser l'inférence des LLM en rééquilibrant les rôles respectifs des processeurs centraux et graphiques.