Consolidation RLVR : paradigmes de fusion multi-domaines
Comparaison de Merge, Mix RL et MOPD pour fusionner des modèles experts sans perte de capacités.
arXiv cs.AI · cs.LG · cs.CL·Siye Wu, Kai Yang, Yuchen Cai, Xin Xu·27 août 2026
Lu et jugé par Fellow · impact léger
Étude comparative empirique avec résultats chiffrés, mais portée incrémentale et non couverte ailleurs.

Image · Source originale
Cette étude compare trois paradigmes de fusion (Merge, Mix RL, MOPD) pour consolider des modèles entraînés par Reinforcement Learning with Verifiable Rewards (RLVR). Si les performances moyennes varient peu, les écarts peuvent atteindre 8,6 points selon le domaine. Les auteurs fournissent des directives pratiques : privilégier Merge pour une fusion économique, Mix RL pour l'entraînement unifié, et MOPD pour préserver les gains spécifiques.