Toutes les news taguées avec ce sujet.
L'hébergeur allemand Hetzner, connu pour ses serveurs bon marché, préparerait un service d'inférence de modèles de langage.
Un framework où un petit modèle décide lui-même quand solliciter un LLM, réduisant fortement les coûts d'inférence sans sacrifier la précision.
Google grave son architecture Gemini directement dans le silicium, un pari risqué mais potentiellement décisif pour l'inférence à grande échelle.
Un nouveau framework guide des agents de codage pour transformer des implémentations de référence en déploiements multi-GPU optimisés, avec des gains massifs de latence.
Un article pédagogique détaille la mécanique interne des LLM, du tokenisation à la génération du premier token en sortie.
Iroh propose une architecture peer-to-peer pour faire tourner des LLM en distribué, sans infrastructure centralisée.
Reame est un serveur d'inférence tournant sur CPU qui optimise ses performances dynamiquement à mesure qu'il traite des requêtes.
Alors que les dépenses en IA s'envolent, les organisations cherchent en urgence des stratégies pour maîtriser des factures de plus en plus difficiles à justifier.
Xiaomi détaille les techniques d'optimisation d'inférence de son modèle MiMo v2.5, centré sur l'architecture Hybrid Sliding Window Attention.
NVIDIA détaille comment les choix d'architecture d'un LLM influencent directement le débit de tokens et la latence perçue par l'utilisateur.
Un outil open-source MIT pour analyser ses logs d'appels LLM et repérer les requêtes qui ne nécessitent pas un modèle coûteux.
Hugging Face intègre un backend transformers natif dans vLLM, permettant d'atteindre des vitesses d'inférence optimales sans surcoût de conversion.
Des chercheurs montrent que l'échec d'un agent LLM est prévisible dès le premier tour via ses représentations internes, permettant d'économiser jusqu'à 47 % du calcul d'inférence.
Une nouvelle méthode de compression du cache KV à l'inférence divise les états en composantes basse fréquence partagées et résidus haute fréquence, sans réentraînement.
Une nouvelle méthode réduit jusqu'à 8,3× la mémoire du cache KV des LLMs en contexte long, sans réentraîner le modèle de base.
NVIDIA présente son CPU Vera, conçu pour accélérer les tâches intermédiaires entre les étapes GPU dans les systèmes agentiques à grande échelle.
Un benchmark comparatif montre que les GPU AMD offrent désormais une alternative sérieuse aux puces NVIDIA pour l'inférence de modèles LLM à moindre coût.
Alors que le coût des tokens s'effondre et que les régulateurs resserrent leur emprise, la capacité des acteurs de l'IA à maintenir leurs marges est remise en question.
Un développeur publie un guide complet pour exécuter les meilleurs LLM disponibles directement sur sa machine, sans dépendance cloud.
OrbitQuant propose une quantification post-entraînement agnostique aux données pour les DiTs, atteignant l'état de l'art jusqu'en W2A4 sur FLUX.1, Wan 2.1 et CogVideoX.
Une méthode d'inférence sans entraînement améliore l'utilisation des preuves dans les LLMs sur des contextes de 128K tokens.
NVIDIA présente sa solution Confidential Computing pour protéger les données en cours d'inférence sans compromis sur les performances.
Une méthode de sampling corrélé qui réduit la redondance lors du scaling de l'inférence, sans sacrifier la parallélisation ni la rigueur statistique.
Le modèle Gemma 4 de Google tourne désormais en inférence ultra-rapide via Cerebras pour alimenter des applications vocales en temps réel.
Mistral publie Leanstral 1.5, un nouveau modèle conçu pour offrir de hautes performances avec une empreinte computationnelle réduite.
Le DGX Spark de NVIDIA s'attaque au marché des stations de travail IA compactes, face au Mac Studio d'Apple et d'autres alternatives.
DeepMind ouvre l'accès à deux nouveaux modèles Gemini optimisés pour la légèreté et la rapidité d'inférence.
Le projet ZLUDA franchit une nouvelle étape avec sa version 6, permettant de faire tourner des workloads CUDA natifs sur du matériel AMD ou Intel.
Cerebras annonce le support de Gemma 4 sur son infrastructure, combinant sa vitesse d'inférence record avec les capacités multimodales du modèle de Google.
Meta a développé un ASIC CXL maison permettant de recycler la mémoire DDR4 de serveurs obsolètes, réduisant la taille de certaines flottes d'inférence d'un quart.