Toutes les news taguées avec ce sujet.
Une alternative lisse au clipping de PPO et GRPO testée sur Llama-3.2-1B pour le post-entraînement de LLM par RLHF.
Une méthode de feedback adaptatif ajuste dynamiquement la longueur du préfixe de solution fourni au modèle, doublant la précision de GRPO sur les problèmes mathématiques difficiles.
Deux modèles s'affrontent et se notent mutuellement pour améliorer leur raisonnement, sans étiquettes de processus ni reward model externe.
TREK combine distillation et GRPO pour débloquer les prompts difficiles que le modèle étudiant ne sait pas résoudre seul.
Un framework qui dépasse GRPO en assignant des récompenses différenciées selon le rôle sémantique de chaque action dans un rollout agentique.
Un framework RLAIF appliqué à la recherche d'emploi révèle les failles du reward shaping avec GRPO et propose un correctif déterministe contre le verbatim-copying.
Un modèle de 3 milliards de paramètres rivalise avec des géants via une combinaison inédite de fine-tuning supervisé et d'optimisation GRPO.