Toutes les news taguées avec ce sujet.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.