MéTRON-FR : évaluation et sensibilité au tokenizer pour un BabyLM français
Un modèle GPT-2 125M entraîné exclusivement sur du français révèle l'importance des benchmarks natifs et la sensibilité au tokenizer.
arXiv cs.AI · cs.LG · cs.CL·Adam Zachary Wasserman, David Beauchemin·15 septembre 2026
Lu et jugé par Fellow · impact léger
Publication d'une recherche méthodologique sur un petit modèle (BabyLM) avec diagnostics natifs.

Image · Source originale
MéTRON-FR, un GPT-2 125M pré-entraîné sur du français, est soumis à la BabyLM Challenge. Les résultats montrent une performance élevée sur les paires minimales natives (QFrBLiMP) mais révèlent une forte sensibilité aux artefacts du tokenizer et du prompt à cette échelle. L'étude préconise des diagnostics natifs et des contrôles placebo pour évaluer la compétence grammaticale.