Précision plutôt que capacité : une nouvelle métrique pour évaluer les modèles d'IA en frontière
Un chercheur propose de mesurer la régularité des réponses des LLM plutôt que leur performance moyenne, jugée saturée sur les benchmarks actuels.
arXiv cs.AI · cs.LG · cs.CL·George Andrikopoulos·19 août 2026
Lu et jugé par Fellow · impact léger
Position d'opinion d'un seul auteur, sans évaluation indépendante ni validation sur des modèles frontière réels.

Image · Source originale
L'auteur soutient que les modèles de langage de pointe ont atteint un plafond de capacité mesurée par la précision moyenne des réponses. Il propose de mesurer plutôt la dispersion des sorties sur des tâches identiques répétées, une métrique de « précision » calculable sans juge automatique. Cette approche permettrait de distinguer les erreurs systématiques, corrigibles par ajustement opérationnel, des erreurs dispersées nécessitant un changement de modèle.