Lissage et validation par prédiction pour l'évaluation désagrégée des systèmes d'IA
Une méthode bayésienne améliore l'estimation des performances par domaine quand les échantillons labellisés sont rares.
arXiv cs.AI · cs.LG · cs.CL·Sho Kawano, Zehang Richard Li, Paul A. Parker·17 septembre 2026
Lu et jugé par Fellow · impact léger
Contribution méthodologique statistique incrémentale sur l'évaluation désagrégée, sans nouvelle capacité ni déploiement concret.

Image · Source originale
Les auteurs proposent le prediction-powered smoothing (PP-S), un modèle bayésien qui affine les estimations de performance par domaine en s'appuyant sur la small area estimation. Ils dérivent aussi un score de validation croisée pour choisir entre estimateurs directs et lissés. Testée sur un benchmark vérifiable et sur du trafic d'agents jugé par des humains, la méthode surpasse les approches directes en précision d'estimation.