Toutes les news taguées avec ce sujet.
Avec DeepSeek-V3 671B, NVIDIA atteint 1 648 TFLOPs par GPU sur GB300 NVL72, illustrant l'importance croissante de la communication inter-GPU.
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
Tencent publie Hy3, un modèle MoE de 295 milliards de paramètres qui affiche des performances comparables aux modèles de taille trillion.
Un essai de réflexion sur le compromis fondamental entre largeur (MoE, parallélisme) et profondeur (chaînes de raisonnement) dans l'architecture des modèles de langage.
Agents-A1 démontre qu'élargir l'horizon agentic d'un modèle MoE 35B suffit à rivaliser avec des LLM mille fois plus grands.
Un pipeline open-weight combine NER, résolution d'entités Wikidata et un modèle MoE pour construire des knowledge graphs signés à partir de corpus de presse.
Z.ai publie GLM-5.2 sous licence MIT : un modèle MoE de 753 milliards de paramètres qui s'impose en tête des classements open-weights.
Des chercheurs montrent que l'optimiseur Muown opère sur une géométrie riemannienne et proposent AngularMuown, une version améliorée avec un multiplicateur angulaire explicite.