Apprentissage de l'allocation adaptative du calcul de test
Un modèle LLM apprend à sélectionner le niveau de raisonnement nécessaire par problème, réduisant le coût de calcul de 41%.
arXiv cs.AI · cs.LG · cs.CL·Gijs Kassenaar, Zhao Yang, Vincent François-Lavet·20 août 2026
Lu et jugé par Fellow · impact léger
Méthode testée sur un seul modèle 1.5B et MATH/GSM8K, sans évaluation indépendante ni déploiement réel.

Image · Source originale
Ce papier explore un mécanisme où un modèle choisit explicitement son mode de raisonnement (NoThink, Short ou Long) via le Group Relative Policy Optimization (GRPO). Testé sur des problèmes de mathématiques, le modèle maintient une précision proche de la base tout en réduisant de 41% la longueur moyenne des réponses. La méthode se généralise sans réentraînement, offrant d'importantes économies de tokens sur des benchmarks plus simples comme GSM8K.