Toutes les news taguées avec ce sujet.
Une méthode de reinforcement learning test-time exploitant des probes exécutables pour améliorer les modèles de code.
Une méthode exploite l'historique des échanges homme-agent pour personnaliser les modèles sans réentraînement lourd, avec des gains mesurables sur des tâches réelles.