TaH2 : des transformers en boucle adaptatifs pour améliorer le test-time scaling
Une méthode de post-training qui concentre les itérations supplémentaires sur les tokens qui en tirent vraiment profit, avec des gains mesurés sur AIME.
arXiv cs.AI · cs.LG · cs.CL·Yichen You, Tianyu Fu, Aosong Feng, Xingtai Lv·28 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'une méthode de test-time scaling, gains mesurés sur un seul benchmark (AIME), pas de couverture externe.

Image · Source originale
Les transformers en boucle réutilisent des couches pour du calcul latent, mais peinent souvent à battre les modèles classiques à compute égal. Les auteurs montrent que tous les tokens ne bénéficient pas d'itérations supplémentaires et proposent TaH2, qui post-entraîne conjointement le modèle et un décideur d'itération via une supervision par anticipation de profondeur. Sur AIME, TaH2 améliore la pente précision-compute de 53% et dépasse la précision maximale du baseline de 3,4 points à compute équivalent.