NVIDIA accélère l'entraînement dropless des modèles MoE dans JAX avec Transformer Engine
NVIDIA détaille une optimisation technique pour entraîner des modèles Mixture of Experts sans perte de tokens, via son Transformer Engine intégré à JAX.
NVIDIA Developer Blog·Tanya Lenz·14 septembre 2026
Lu et jugé par Fellow · impact notable
NVIDIA livre des optimisations techniques vérifiées (10x gain de débit) pour JAX sur MoE, appliquées concrètement à DeepSeek-V3.

Image · Source originale
NVIDIA présente une méthode pour accélérer l'entraînement dropless des modèles Mixture of Experts (MoE) dans JAX grâce à son Transformer Engine. L'architecture MoE, utilisée par DeepSeek, Qwen ou Mixtral, permet d'atteindre des performances comparables aux modèles denses avec un coût de calcul réduit grâce au calcul conditionnel.