Toutes les news taguées avec ce sujet.
Une équipe de recherche fait passer l'apprentissage par renforcement pur (« zero RL ») à l'échelle du trillion de paramètres, avec des capacités de raisonnement qui émergent sans supervision.
Des chercheurs proposent de faire de la vérification un nouvel axe de scaling pour les LLM, sans entraînement supplémentaire.
Un essai de réflexion sur le compromis fondamental entre largeur (MoE, parallélisme) et profondeur (chaînes de raisonnement) dans l'architecture des modèles de langage.
Retour d'expérience détaillé sur le passage à l'échelle du coding agentique chez Lovable, après une dépense de 85 000 $ en tokens.
Agents-A1 démontre qu'élargir l'horizon agentic d'un modèle MoE 35B suffit à rivaliser avec des LLM mille fois plus grands.
Dwarkesh Patel expose le pari des grands labs : entraîner les IA sur des millions de tâches vérifiables via du RL pour atteindre l'AGI.