Toutes les news taguées avec ce sujet.
Analyse prospective sur les futures architectures LLM et le raisonnement latent.
L'éditeur de code Zed révèle comment l'approche agentielle résout enfin la promesse de son architecture.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.
Un guide technique détaillé expliquant l'architecture et l'entraînement des modèles de langage basés sur la diffusion.
Un article technique explore une variante continue des diffusion language models, alternative potentielle aux LLM autoregressifs classiques.
Analyse technique des défauts des GPU Nvidia pour l'inférence et présentation de l'architecture du processeur OpenAI Jalapeño.
Une analyse technique exhaustive marque l'achèvement du projet de rétro-ingénierie du GPU de la puce M1.
Un article revient sur les fondamentaux du RAG et plaide pour une approche moins complexe que les architectures souvent présentées.
Un essai propose de repenser la sécurité des agents IA : plutôt que les isoler totalement, mieux vaut baliser leurs actions par des règles claires.
Une architecture neuronale remplace les embeddings standards par des coordonnées 2D.
L'efficacité récente des agents proviendrait de la convergence entre l'amélioration des modèles et la maturation de leurs interfaces.
Analyse technique des mécanismes internes et des implications de l'accès mémoire sur les unités de traitement graphique.
L'architecture des grands modèles de langage valide la philosophie des outils Unix.
NVIDIA dévoile AVO, une architecture frontière pour agents autonomes capables de tâches longues.
Comment intégrer les LLM dans l'architecture logicielle pour créer des systèmes extensibles et maintenables.
Un nouveau modèle du laboratoire chinois Moonshot AI, misant sur une architecture d'attention linéaire pour l'efficacité.
IBM Research explore l'optimisation de la mémoire des agents conversationnels via une approche de type modèle de Markov caché.
Anthropic dresse un état des lieux des architectures multiagents actuelles et des difficultés pratiques qu'elles posent en production.
L'architecture actuelle des LLMs atteint ses limites. Plusieurs acteurs proposent des approches radicales pour réduire les coûts et améliorer le raisonnement.
Une analyse technique détaillée de l'architecture de vLLM, moteur d'inférence open-source devenu référence pour servir des LLM à grande échelle.
Une méthode d'infrastructure découpe le raisonnement long en étapes indépendantes pour limiter la propagation d'erreurs.