Annotations séquentielles optimales pour l'évaluation off-policy
Une méthode statistique pour arbitrer entre annotation automatique bruitée et expertise humaine coûteuse en évaluation off-policy.
arXiv cs.AI · cs.LG · cs.CL·Woojin Chae, Ezinne Nwankwo, Haitong Qin, Angela Zhou·22 septembre 2026
Lu et jugé par Fellow · impact notable
Méthode d'évaluation off-policy doublement robuste optimisant l'annotation sous budget, validée sur deux jeux de données réels avec réductions RMSE de 17 à 68%.

Image · Source originale
Les auteurs proposent une approche d'évaluation off-policy doublement robuste avec récompenses manquantes, optimisant les probabilités d'annotation sous budget limité. La méthode combine labels bon marché (type LLM-as-a-judge) et annotations expertes plus fiables mais coûteuses. Testée sur des données de terrain d'une ONG luttant contre le sans-abrisme et sur LMArena, elle réduit l'erreur RMSE de 17 à 68%.