Critical-State RL : diagnostiquer les états entraînables dans l'usage d'outils multi-tours
Une méthode identifie précisément quels appels de modèle méritent l'entraînement dans les interactions multi-tours avec outils, améliorant les performances de 14 points sur certaines tâches.
arXiv cs.AI · cs.LG · cs.CL·Zixiang Chen, Wenting Zhao, Zhepeng Cen, Akshara Prabhakar·21 septembre 2026
Lu et jugé par Fellow · impact notable
Méthode RL avec gain vérifiable de 14 points sur BFCL v4 pour l'usage multi-tours d'outils, apportant une solution incrémentale mais concrète à un problème identifié.

Image · Source originale
Les échecs d'usage d'outils multi-tours dépendent souvent d'un seul appel modèle, mais la variance de récompense seule ne permet pas d'identifier lequel entraîner. Critical-State RL sépare la variation liée à l'action du bruit de continuation via un échantillonnage imbriqué, puis optimise la politique aux états sélectionnés. Testée sur BFCL v4, la méthode améliore les performances de 14 points de pourcentage sur les tâches de fonction manquante, contre stagnation ou dégradation avec des états alternatifs.