Toutes les news taguées avec ce sujet.
Une discussion technique explore ce que recouvre réellement le paramètre 'effort' proposé par certains fournisseurs de LLM.
Moonshot AI publie un nouveau modèle multimodal sur Hugging Face.
Un nouveau cadre transfère le raisonnement logique de modèles textuels vers des modèles audio via un alignement on-policy.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Une variante du GRPO utilisant des informations privilégiées guide le modèle vers des solutions correctes sans déstabiliser l'apprentissage.
Une nouvelle approche exploite la structure spectrale des poids pour accélérer et fusionner des modèles entraînés par RLVR, avec des gains d'efficacité mesurables.
Analyse technique des méthodes pour optimiser les ressources de calcul.
Une étude sur les échecs comme banc d'essai contrôlé révèle comment les choix de pretraining déterminent les gains obtenus par le RL post-training.
Un post Reddit relaie une affirmation selon laquelle GPT-5.6 aurait résolu un problème ouvert en optimisation convexe, dans la foulée de l'annonce d'OpenAI sur une preuve mathématique.
Une équipe de recherche fait passer l'apprentissage par renforcement pur (« zero RL ») à l'échelle du trillion de paramètres, avec des capacités de raisonnement qui émergent sans supervision.
Une nouvelle méthode permet de corriger directement les erreurs de raisonnement des LLM sans tout régénérer, avec un gain de correction de 25%.
Un challenge massif sur le modèle Nemotron identifie les techniques les plus efficaces pour améliorer les capacités de raisonnement des IA.
Une architecture multi-agents surpasse les systèmes classifs au challenge QANTA 2026 via des politiques de raisonnement ciblées.
Un outil open-source pour rendre visibles les raisonnements internes des grands modèles de langage, présenté sur Hacker News.