L'échantillonnage stratégiquement diversifié améliore l'auto-entraînement des LLM
Privilégier la diversité des stratégies plutôt que la seule exactitude des réponses produit de meilleures données d'auto-entraînement pour les LLM.
arXiv cs.AI · cs.LG · cs.CL·Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata·25 septembre 2026

Image · Source originale
Les chercheurs introduisent GROOT et une variante de Verbalized Sampling pour générer des données d'auto-entraînement présentant une diversité stratégique réelle, plutôt que des échantillons IID filtrés uniquement sur la correction. Sur des tâches de programmation compétitive et de prédiction de chapitre suivant, ces données surpassent l'approche IID classique, y compris comme base pour le RL et le test-time scaling. Fait notable : des traces incorrectes mais stratégiquement diverses issues de Qwen3-4B battent la distillation IID d'un professeur à 235B de paramètres.