Apprendre à s'arrêter sans apprendre à s'arrêter : l'entraînement à la confiance améliore l'efficacité du raisonnement
Un fine-tuning auto-supervisé basé sur la confiance réduit de 25% les tokens générés par les modèles de raisonnement, sans perte de précision.
arXiv cs.AI · cs.LG · cs.CL·Parsa Hosseini, Akasha Tigalappanavara, Sumit Nawathe, Chenrui Fan·25 septembre 2026

Image · Source originale
Des chercheurs montrent qu'entraîner des modèles de raisonnement à prédire leur propre confiance en cours de raisonnement, sur seulement 600 exemples, réduit la longueur des traces générées jusqu'à 25% à précision égale. Aucune contrainte explicite de longueur ou d'arrêt n'est utilisée dans l'entraînement ni à l'inférence. Testé sur Gemma, Qwen, Nemotron et GPT-OSS sur des benchmarks de maths, sciences et code, l'approche préserve la structure du raisonnement du modèle de base.