Faire co-évoluer harness et modèle : la correction on-policy aide les modèles faibles à combler leur retard
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
arXiv cs.AI · cs.LG · cs.CL·Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra·8 septembre 2026
Lu et jugé par Fellow · impact notable
Papier de recherche avec résultats empiriques chiffrés sur sept tâches et méthode reproductible, mais non revu par pairs ni indépendamment validé.

Image · Source originale
Sur sept tâches agentiques d'entreprise, entraîner un modèle plus faible sur les trajectoires complètes d'un expert dégrade les performances de 4 à 30 points, car le modèle adopte une stratégie de planification qu'il ne maîtrise pas et qui ne correspond plus au harness évolué pour son style natif. Les auteurs proposent un pipeline de correction on-policy, piloté par un agent MLE méta-niveau, qui localise le tour défaillant dans le rollout du modèle faible et fait réécrire uniquement ce tour par l'expert. Cette approche préserve le style de planification du modèle tout en combinant les gains du harness et de la supervision experte.