Le « harness learning » permet une adaptation généralisable au moment de l'inférence
Une nouvelle méthode entraîne un modèle proposeur à réviser le harness d'un agent via retour d'exécution, sans mise à jour des poids.
arXiv cs.AI · cs.LG · cs.CL·Alvin Zhang, Xuecheng Liu, Zixuan Wang, Fahim Tajwar·28 septembre 2026

Image · Source originale
Les chercheurs introduisent le harness learning, qui entraîne par renforcement un modèle proposeur à réviser le programme organisant les appels modèle et l'usage d'outils, en s'appuyant sur les retours d'exécution. À l'inférence, ce proposeur affine le harness pour de nouvelles tâches sans toucher aux poids du modèle. Les expériences sur le raisonnement et le question answering multi-sauts montrent un transfert vers des tâches non vues et une amélioration continue sur plusieurs itérations.