QVIRL : apprentissage par renforcement inverse variationnel basé sur Q
Une nouvelle méthode Bayesian IRL qui infère une distribution de récompenses via l'apprentissage d'une distribution sur les Q-values.
arXiv cs.AI · cs.LG · cs.CL·Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis·17 août 2026
Lu et jugé par Fellow · impact léger
Méthode IRL bayésienne incrémentale, testée sur benchmarks académiques (gridworlds, Atari), sans validation indépendante ni déploiement réel.

Image · Source originale
Q-based Variational IRL (QVIRL) est une méthode d'apprentissage par renforcement inverse (IRL) qui estime une distribution postérieure sur les récompenses à partir de démonstrations d'experts. Elle apprend principalement une distribution variationnelle sur les Q-values optimaux, combinant scalabilité et quantification de l'incertitude. L'approche démontre des performances solides en apprentissage par compagnonnage sur diverses tâches, notamment des environnements ATARI, et est la première méthode Bayesian IRL à s'entraîner sur des pixels bruts.