RECHERCHE
ISO : une pile d'optimisation native pour le RLVR
Une nouvelle approche exploite la structure spectrale des poids pour accélérer et fusionner des modèles entraînés par RLVR, avec des gains d'efficacité mesurables.
arXiv cs.AI · cs.LG · cs.CL·Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee·21 juillet 2026

Image · Source originale
Des chercheurs proposent ISO (Isospectral Optimization), un cadre d'optimisation pour le RL avec récompenses vérifiables reposant sur le concept d'héritage spectral des poids. La méthode inclut ISO-Merger, pour fusionner des modèles spécialistes sans données ni réentraînement, et ISO-Optimizer, qui accélère l'entraînement en gardant le spectre des poids fixe. Sur Qwen3-8B, l'approche atteint une précision équivalente avec nettement moins d'étapes d'entraînement.