AdviSD : apprendre à conseiller les LLM frontières via self-distillation multi-tours ciblée
Une méthode entraîne un petit modèle « conseiller » à guider des LLM figés plus puissants, avec des gains mesurés sur BFCL-v3 et EnvScaler.
arXiv cs.AI · cs.LG · cs.CL·Rishabh Agrawal, Hejie Cui, Shasha Li, Shanchan Wu·29 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche avec gains mesurés sur benchmarks propriétaires (BFCL-v3, EnvScaler), non repris ailleurs, portée méthodologique limitée.

Image · Source originale
AdviSD combine reinforcement learning basé sur les résultats et self-distillation sélective pour entraîner un modèle conseiller (advisor) qui pilote un exécuteur LLM figé via des conseils en langage naturel. La méthode sélectionne les corrections à apprendre selon l'écart de score qu'elles produisent, sans nécessiter les probabilités de l'exécuteur ni des rollouts supplémentaires. Avec des advisors Qwen3-8B pour Gemini et Claude, AdviSD dépasse advisor-GRPO de 4,2 à 6,4 points sur BFCL-v3 et généralise à des tâches hors domaine et à d'autres familles de modèles.