Toutes les news taguées avec ce sujet.
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.
Une étude révèle que le taux d'apprentissage effectif (ELR) unifie les dynamiques de perte à travers diverses configurations.
Un nouveau framework évalue les propriétés des tokenizers et leur impact réel sur les performances des modèles.
Une nouvelle méthode évalue l'influence des exemples d'entraînement sans cible de validation, révélant une bascule littérature vers STEM au fil du pré-entraînement.
Un modèle de 5 milliards de paramètres entraîné exclusivement sur du contenu de primaire pour étudier l'acquisition de connaissances.
Une nouvelle méthode de pré-entraînement pour MLLM remplace les entités textuelles par des objets visuels, améliorant l'efficacité des données de façon marquée.