Harness-Zero : distiller les gains d'un harnais d'agent spécialisé dans les poids du modèle
Une méthode pour transférer les bénéfices d'un harnais d'agent optimisé vers un modèle, sans dépendre de ce harnais au déploiement.
arXiv cs.AI · cs.LG · cs.CL·Haoran Ye, Yuxing Lu, Haonan Dong, Zhaochen Su·21 septembre 2026
Lu et jugé par Fellow · impact notable
Méthode de distillation validée empiriquement (23,3%→44,3% de succès moyen) sur trois domaines, résultat vérifiable mais un seul papier non encore repris.

Image · Source originale
Les harnais d'agents (systèmes médiateurs entre modèle et environnement) améliorent les performances mais sont liés à un contexte de déploiement précis. Harness-Zero propose une distillation via un « agent-as-harness » qui corrige les réponses de l'étudiant avant exécution, générant des démonstrations d'entraînement. Le fine-tuning sur ces trajectoires internalise le comportement induit, permettant de retirer le harnais spécialisé au déploiement tout en conservant les gains, testé sur des tâches de connaissance, d'usage d'outils et de science.