Des modèles du monde discriminatifs pour améliorer les agents web
Un nouvel objectif d'entraînement aligne la prédiction d'états web sur le besoin réel des rankers d'actions, avec des gains mesurables sur plusieurs benchmarks.
arXiv cs.AI · cs.LG · cs.CL·Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, Chuyi Shang·2 septembre 2026
Lu et jugé par Fellow · impact notable
Papier scientifique avec une nouvelle méthodologie d'entraînement (predicted-state matching) et gains vérifiés sur plusieurs benchmarks (WebArena).

Image · Source originale
Les agents web utilisent des modèles du monde pour prédire l'état résultant d'actions candidates, puis les classer via un ranker ou un Process Reward Model. Les chercheurs montrent que l'entraînement classique par prédiction supervisée du prochain état est mal aligné avec cet usage, et proposent le predicted-state matching, un objectif qui force les représentations à discriminer entre actions alternatives. Testée sur WebArena, WebPRMBench et WebArena-Lite, cette approche améliore le classement des actions et le taux de succès final des tâches.