Toutes les news taguées avec ce sujet.
Une loi exacte explique l'interaction entre lr et weight decay dans les réseaux normalisés.
Deux nouvelles preuves établissent des bornes de mélange en Õ(d²) pour l'échantillonnage sur les polytopes et cônes tronqués.
Une analyse technique des choix de design ayant permis à l'interface de Superhuman de maximiser l'attention et la réactivité.
L'analyse détaillée des goulets d'étranglement qui entravent le débit d'inférence.
Une étude révèle que le taux d'apprentissage effectif (ELR) unifie les dynamiques de perte à travers diverses configurations.
Une nouvelle méthode de quantization permet à des modèles compressés en 4-bit de surpasser leurs versions en pleine précision.
Une architecture neuronale remplace les embeddings standards par des coordonnées 2D.
Hugging Face analyse l'impact de l'optimisation sur les benchmarks de reconnaissance automatique de la parole.
Cette méthode réduit l'espace de recherche des splits via des centroïdes informés par les données.
Liquid publie LFM2.5-DSSpark, optimisé pour réduire la latence et accélérer l'inférence sur les workloads standard.
Nouveau format GGUF dynamique 3.0 pour optimiser l'inférence locale et l'efficacité des modèles.
Une reproduction du classifieur WEASEL 2.0 propose une règle adaptative pour réduire la mémoire et le temps de calcul.
Une méthode exploitant l'expérience itérative et les signaux de feedback pour améliorer les performances des LLM.
DFlash 2 accélère le drafting en exploitant le parallélisme pour améliorer la latence.
Un nouveau framework de reroutage sélectif combine données temps réel et prévisions à court terme pour optimiser le trafic urbain.
Caractérisation des facettes du polytope multi-séparateur et liens avec le lifted multicut pour la segmentation d'images.
Optimiser l'inférence LLM pour lisser les pics de latence et garantir une expérience utilisateur fluide.
Un nouveau cadre différentiable basé sur la programmation linéaire pour optimiser efficacement les réseaux de neurones.
Des modèles de substitution accélèrent l'évaluation de l'impact du trafic pour la planification des travaux.
Le sMuon étend l'optimiseur Muon au fine-tuning efficace pour améliorer les performances LoRA.
Cet outil optimise les appels à l'API de Claude en filtrant le code via des hooks, diminuant significativement les coûts.
Cette méthode sans entraînement accélère les LLM via des arbres de candidats parallèles, dépassant les vitesses des approches classiques.
Une méthode réduit la consommation de tokens de 26% dans le codage agentic via l'éviction réversible.
Une méthode améliore l'adaptation des agents LLM via un diagnostic en boucle fermée et un raffinement proximal.
Une méthode de réutilisation de cache fine-grained pour optimiser l'efficacité et la précision du RAG.
Red Hat explore comment optimiser l'inférence des LLM en rééquilibrant les rôles respectifs des processeurs centraux et graphiques.