Toutes les news taguées avec ce sujet.
Une méthode décompose les normalizing flows pour isoler des statistiques pivots robustes aux paramètres nuisibles.
Une nouvelle méthode Bayesian IRL qui infère une distribution de récompenses via l'apprentissage d'une distribution sur les Q-values.