AUSO : optimisation unifiée des compétences au niveau des actions, de l'internalisation à l'utilisation
Une nouvelle méthode d'entraînement d'agents module l'usage des compétences action par action, au lieu d'un choix uniforme pour toute une trajectoire.
arXiv cs.AI · cs.LG · cs.CL·Huizu Lin, Chengkai Huang, Tianqi Gao, Tao Huang·21 août 2026
Lu et jugé par Fellow · impact léger
Méthode incrémentale validée sur trois benchmarks agents (ALFWorld, WebShop, SearchQA) sans large adoption ni comparaison indépendante.

Image · Source originale
AUSO propose un processus d'entraînement progressif qui unifie apprentissage et usage des compétences chez un agent. La méthode compare chaque action avec et sans guidage de compétence, puis combine ce signal avec l'avantage de résultat de la trajectoire pour renforcer les actions bénéfiques et supprimer les actions nuisibles. Les compétences passent ainsi progressivement d'une supervision externe à une connaissance décisionnelle intégrée.