Toutes les news taguées avec ce sujet.
Nouveau modèle textuel optimisé pour le temps réel et l'efficacité.
vLLM ajoute le support du décodage spéculatif pour les GPU AMD, promettant une accélération de l'inférence LLM sur cette plateforme.
Georgi Gerganov réagit à l'acquisition d'HuggingFace par Nvidia et évoque l'impact sur le développement futur de llama.cpp et ggml.
L'infrastructure d'inférence nécessite une optimisation globale mémoire, stockage et réseau pour réduire latence et coûts.
Un nouveau cadre exploite le parallélisme des opérateurs sur les SoC hétérogènes pour optimiser latence et débit.
Le modèle Qwen 2.5 72B est désormais proposé sur l'inférence Cerebras, atteignant une vitesse de 1500 tokens par seconde.
Troisième volet d'une série sur le co-design de modèles IA, avec cinq règles pratiques pour choisir la longueur et le mécanisme de draft.
Une optimisation d'inférence 35x plus rapide permet désormais le streaming vidéo génératif en temps réel et interactif.
Le nouveau modèle compact de Mistral surpasse ses prédécesseurs en performance et en latence.
Analyse technique des défauts des GPU Nvidia pour l'inférence et présentation de l'architecture du processeur OpenAI Jalapeño.
Une analyse comparative de la performance des modèles d'IA sur smartphones, processeurs et NPU.
NVIDIA simplifie le déploiement de modèles open via TensorRT Model Connect, automatisant conversion et runtime.
OpenAI dévoile son puce inference Jalapeño, surpassant NVIDIA en efficacité énergétique lors de la conférence Hot Chips.
Le déploiement de modèles sur poste personnel demande une rigueur technique et une gestion fine des ressources matérielles.
L'analyse détaillée des goulets d'étranglement qui entravent le débit d'inférence.
Alibaba dévoile une nouvelle architecture visant à optimiser le rapport coût-performance pour les modèles de langage.
Zhipu AI lance son nouveau modèle Flash, optimisé pour la latence et l'efficacité.
NVIDIA Dynamo intègre une fonctionnalité de récupération 'shadow engine' pour restaurer les capacités d'inférence en quelques secondes.
Présentation d'une version hardware légère de LPU capable d'exécuter l'inférence de MicroGPT.
Xiaomi dévoile un appareil dédié à l'IA locale capable de faire tourner un modèle de 120 milliards de paramètres à 330 tokens/s.
NVIDIA dévoile le processeur Groq 3 LPX pour l'accélération de l'inférence interactive sur la plateforme Vera Rubin NVL72.
Les premiers résultats de performance des puces Groq 3 apportent des indices, mais laissent aussi de nombreuses questions sans réponse sur l'investissement massif de Nvidia.
Face à l'explosion des workflows agentiques multi-étapes, NVIDIA met en avant l'efficacité énergétique de ses puces Vera Rubin et Blackwell.
Une nouvelle méthode TTT par blocs concilie expressivité dynamique et parallélisation matériel, tout en améliorant l'extrapolation de longueur.
Un article de forum décortique les réglages techniques négligés qui plombent silencieusement les performances des LLM exécutés en local.
Mythic propose une puce analogique compute-in-memory pour réduire la consommation énergétique de l'inférence.
Nvidia présente une approche pour maximiser le rendement énergétique des data centers dédiés à l'inférence IA, où le mégawatt devient la ressource critique.
Un nouveau cadre théorique optimise l'allocation des requêtes entre modèles IA en arbitrant entre estimation coûteuse et rapidité.
Liquid publie LFM2.5-DSSpark, optimisé pour réduire la latence et accélérer l'inférence sur les workloads standard.
Nouveau format GGUF dynamique 3.0 pour optimiser l'inférence locale et l'efficacité des modèles.