RECHERCHE
DataOrchestra : orchestrer un traitement personnalisé des données de pré-entraînement, exemple par exemple
Un framework qui décide, pour chaque échantillon de données, s'il faut le supprimer, le laisser tel quel ou le nettoyer via des opérations sur mesure.
arXiv cs.AI · cs.LG · cs.CL·Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu·27 juillet 2026

Image · Source originale
DataOrchestra propose un orchestrateur qui adapte le traitement des données de pré-entraînement à chaque exemple, plutôt que d'appliquer une stratégie uniforme à tout un corpus. Il choisit entre suppression, conservation ou nettoyage, et génère des instructions précises pour des modèles outils de réécriture. Testé sur des modèles de 0,5B à 7B entraînés depuis zéro, il obtient des gains stables sur 11 benchmarks tout en réduisant le compute de traitement.