Trust Guided Decision Transformer : sélectionner le contexte avant le guidage par valeur
Une méthode qui détecte la dérive du contexte dans le Decision Transformer et filtre les suffixes fiables avant de choisir l'action optimale.
arXiv cs.AI · cs.LG · cs.CL·Chainesh Gautam, Raghuram Bharadwaj Diddigi, Chandramouli Kamanchi, Pankaj Dayama·25 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'une méthode existante (Decision Transformer) sur benchmarks D4RL, sans rupture de capacité démontrée.

Image · Source originale
Les auteurs montrent que les performances du Decision Transformer se dégradent sur de longs rollouts à cause d'une dérive du contexte hors distribution d'entraînement, détectable via l'erreur de prédiction du prochain état. TGDT calibre cette erreur par conformal prediction, ne conserve que les contextes jugés fiables, puis applique un critique gelé pour choisir l'action de valeur maximale parmi eux. Sur des tâches D4RL, cette approche réduit les épisodes à erreur persistante et améliore le retour par rapport aux méthodes existantes.