Toutes les news taguées avec ce sujet.
Un framework open-source pour entraîner des agents de bout en bout via des infrastructures d'inférence complexes.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Un système de téléprésence combinant réalité virtuelle et RL adapté aux robots humanoïdes miniatures, testé sur la plateforme ROBOTIS OP3.
Une étude explore si les LLM peuvent extraire des stratégies réutilisables de leurs propres traces de résolution, comme le font les humains avec l'expérience.
Une variante du GRPO utilisant des informations privilégiées guide le modèle vers des solutions correctes sans déstabiliser l'apprentissage.
Une étude identifie un défaut fréquent des LLM en contexte long : recopier le texte source au lieu de raisonner, et propose une méthode de RL pour y remédier.
Un cadre utilisant des outils spécialisés et le reinforcement learning pour améliorer la vérification de réclamations scientifiques.
Une étude sur les échecs comme banc d'essai contrôlé révèle comment les choix de pretraining déterminent les gains obtenus par le RL post-training.
Un nouveau cadre basé sur la diffusion estime l'écart de dynamique entre domaines pour adapter des politiques de RL avec peu d'interactions cible.
Une étude exploratoire compare Muon à AdamW en post-training RL sur des tâches agentiques à récompense éparse, avec des gains significatifs sous certaines conditions.
Une nouvelle méthode combine RL et différentiabilité des dynamiques physiques pour réduire drastiquement le nombre d'interactions nécessaires.
Une méthode RL adaptée aux générateurs de vélocité moyenne qui optimise le récompense sans altérer la vitesse d'échantillonnage.
Optimisation du remplacement préventif de machines via des approches bandit et estimation non paramétrique.
Une équipe de recherche fait passer l'apprentissage par renforcement pur (« zero RL ») à l'échelle du trillion de paramètres, avec des capacités de raisonnement qui émergent sans supervision.
Une méthode d'apprentissage par renforcement affine le crédit accordé à chaque action d'un agent, sans critique additionnelle ni supervision coûteuse.
Une nouvelle stratégie de reset guidé par des configurations performantes améliore l'efficacité et la généralisation du RL pour la conception de circuits.
Une méthode de reinforcement learning utilise l'exposant de Lyapunov pour aller au-delà du pendule de Kapitza et stabiliser un pendule inversé.
Une méthode neuro-symbolique combine base de connaissances Datalog et raffinement par gradient pour améliorer l'efficacité d'échantillonnage en RL.
Un simulateur de conduite rapide et réaliste capable d'entraîner des agents par reinforcement learning à grande échelle.
NVIDIA présente comment des agents IA dotés de compétences RL peuvent automatiser l'exécution de workflows ML complexes.
Un cadre hybride combinant Transformer et Artificial Bee Colony permet de faire du NAS sur GPU grand public, en quelques heures seulement.
Un développeur détaille un projet où un agent, lui-même entraîné par renforcement, orchestre l'entraînement RL d'autres modèles à faible coût.
Un article technique explore comment entraîner des modèles en RL avec le format de quantification NVFP4 sans sacrifier la stabilité de l'entraînement.
REGRIND apprend des politiques de manipulation dextre à partir d'une seule démonstration humaine, avec transfert direct vers le matériel réel.
Un framework de reinforcement learning affine les politiques robotiques pré-entraînées pour les tâches de manipulation industrielle à contact précis.
Un modèle combine LLM et RL multi-objectif pour éviter l'effondrement vers la classe majoritaire dans la détection de fraude, sans rééchantillonnage des données.
Une méthode de feedback adaptatif ajuste dynamiquement la longueur du préfixe de solution fourni au modèle, doublant la précision de GRPO sur les problèmes mathématiques difficiles.
Deux modèles s'affrontent et se notent mutuellement pour améliorer leur raisonnement, sans étiquettes de processus ni reward model externe.
Un environnement open-source basé sur le jeu de combat minimaliste Footsies pour étudier les interactions stratégiques cycliques et non transitives.
Une nouvelle approche combine RL et feedback métacognitif pour que les LLM expriment leur incertitude de façon calibrée.