Le progrès en pré-entraînement vient surtout des données
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Dwarkesh Patel·Dwarkesh Patel·8 septembre 2026
Lu et jugé par Fellow · impact notable
Une étude empirique quantifie (x3,2) le gain d'efficacité des données vs modèles sur 6 ans, avec protocole et résultats.

Image · Source originale
Des chercheurs entraînent des combinaisons de recettes de modèles et de corpus de données représentatifs de chaque année entre 2019 et 2025, à différentes échelles de calcul jusqu'à 1e19 FLOPs. L'évaluation se fait sur les capacités finales via OLMES plutôt que sur la perte d'entraînement, car les jeux de données diffèrent. Résultat : l'amélioration des données expliquerait une part largement supérieure des gains d'efficacité de calcul comparée aux avancées algorithmiques sur les modèles.