RECHERCHE
Interaction on-policy en imitation learning : quand aide-t-elle vraiment ?
Une étude théorique montre que l'interaction avec l'expert allège les exigences de représentation du modèle, avec un nouvel algorithme à l'appui.
arXiv cs.AI · cs.LG · cs.CL·Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher·31 juillet 2026

Image · Source originale
Les auteurs analysent pourquoi l'interaction interactive avec l'expert et l'estimation de fonction de valeur améliorent l'imitation learning face au behavior cloning classique. Ils démontrent que l'interaction permet de se contenter de représenter la fonction de valeur de l'expert plutôt que sa politique complète, et introduisent OVI, un algorithme statistiquement et computationnellement efficace. Un résultat négatif complémentaire prouve que l'interaction est nécessaire : sans elle, tout algorithme offline doit s'adapter à la complexité de la politique experte.