TTPO : optimisation de politiques au temps de test
Une méthode d'apprentissage sans étiquettes qui combine distillation et RL pour améliorer le raisonnement mathématique.
arXiv cs.AI · cs.LG · cs.CL·Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv·27 août 2026
Lu et jugé par Fellow · impact notable
Papier de recherche avec code et benchmarks chiffrés montrant une avancée mesurable en raisonnement mathématique sans labels.

Image · Source originale
TTPO est une méthode de test-time training qui améliore le raisonnement des LLM sans labels. Elle combine self-distillation et Reinforcement Learning asymétrique sur des pseudo-labels, corrigeant les erreurs de vote majoritaire. Sur des benchmarks de niveau compétition, elle égale les méthodes supervisées et booste significativement Qwen3-1.7B.