RECHERCHE
Échantillonner plutôt que réfléchir : le simple sampling répété bat Self-Refine et Reflexion à coût égal
Une étude contrôlée sur 36 comparaisons montre qu'aucune méthode d'auto-critique ne surpasse le sampling répété une fois le coût en tokens égalisé.
arXiv cs.AI · cs.LG · cs.CL·Iliya Mirzaei·30 juillet 2026

Image · Source originale
L'étude reproduit et étend la comparaison de Wang et al. (2024) entre méthodes de raisonnement (Self-Refine, Reflexion, débat, Best-of-N) et sampling répété, en comptant tous les tokens générés. Sur sept méthodes, trois tailles de modèles (1.5B à 7B) et deux benchmarks mathématiques, aucune méthode ne bat de façon fiable le sampling répété à coût équivalent, et dix sont significativement pires — toutes impliquant une auto-inspection du modèle. Le vote majoritaire simple sur les échantillons de Best-of-N surpasse la sélection faite par le modèle lui-même.