Toutes les news taguées avec ce sujet.
Une alternative lisse au clipping de PPO et GRPO testée sur Llama-3.2-1B pour le post-entraînement de LLM par RLHF.
Deux stratégies complémentaires pour réduire le nombre d'évaluations nécessaires lors de l'alignement par RLHF des modèles de diffusion.
NVIDIA détaille comment le reinforcement learning évolue de l'RLHF vers l'RLVR pour des agents IA spécialisés en entreprise.
Une méthode permet aux annotateurs de définir leurs propres axes d'évaluation en langage naturel pour guider l'apprentissage de politiques robotiques.
Une étude empirique montre que plus un modèle est conservateur en offline, plus il est vulnérable au reward hacking lors de l'adaptation online.
Un framework d'optimisation par préférences à plusieurs niveaux pour améliorer l'expressivité émotionnelle des modèles TTS basés sur les LLM.