Toutes les news taguées avec ce sujet.
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Une méthode de compilation qui transforme une description textuelle en petit modèle spécialisé, autonome et réutilisable, sans dépendre d'un LLM distant.
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.
Une analyse examine le rapport entre performance des LLM et coût d'inférence, questionnant la course à la puissance brute.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Un développeur détaille comment atteindre 44 % de score sur le benchmark ARC-AGI-1 avec un budget de calcul dérisoire.
Un nouveau cadre exploite les échecs typiques des petits LLM comme exemples critiques en contexte, pour améliorer le raisonnement à moindre coût.
Une technique qui tronque la mémoire des LLM pendant le raisonnement long, sans perte de performance, pour un scaling moins coûteux.
Alibaba dévoile une nouvelle architecture visant à optimiser le rapport coût-performance pour les modèles de langage.
IBM Research et Hugging Face présentent une méthode pour réduire la consommation de tokens sans perdre en qualité.
L'architecture actuelle des LLMs atteint ses limites. Plusieurs acteurs proposent des approches radicales pour réduire les coûts et améliorer le raisonnement.
Une méthode vise à réduire drastiquement le coût de la distillation de modèles, la rendant accessible pour un déploiement massif.