RECHERCHE
OSReward : évaluation standardisée des modèles de récompense
Un benchmark évalue la fiabilité des VLM comme juges d'agents informatiques.
arXiv cs.AI · cs.LG · cs.CL·Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang·30 juillet 2026

Image · Source originale
OSReward est un benchmark conçu pour évaluer la fiabilité des vision-language models (VLM) chargés de juger les trajectoires des computer-using agents (CUA). L'étude révèle que même les modèles SOTA présentent un biais de clémence systématique, surestimant les réussites. Les auteurs publient également le corpus OS-Shepherd-100K pour combler le fossé entre modèles coûteux et open-source.