RECHERCHE
Comprendre le raisonnement des LLM, du pretraining au post-training via le RL
Une étude sur les échecs comme banc d'essai contrôlé révèle comment les choix de pretraining déterminent les gains obtenus par le RL post-training.
arXiv cs.AI · cs.LG · cs.CL·Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun·17 juillet 2026

Image · Source originale
Des chercheurs utilisent les échecs comme testbed contrôlé pour étudier l'ensemble du pipeline pretraining-RL sur des modèles de 5M à 1B de paramètres. Ils montrent que la performance post-RL est prédictible dès la loss de pretraining, et que le RL n'affine pas simplement la politique SFT : sur les puzzles difficiles, il fait émerger des coups corrects quasi absents après le SFT seul.