Toutes les news taguées avec ce sujet.
Une nouvelle méthode RLVR identifie la première erreur de raisonnement pour guider l'entraînement des LLM.
Comparaison de Merge, Mix RL et MOPD pour fusionner des modèles experts sans perte de capacités.
Une méthode perturbe les trajectoires via des modèles plus faibles pour préserver la diversité et la couverture du raisonnement.