Quand les juges LLM sont d'accord, faut-il les croire ?
Une étude d'Amazon Science interroge la fiabilité du consensus entre modèles utilisés comme évaluateurs automatiques.
Hacker News (filtré IA)·@Betelbuddy·14 septembre 2026
Lu et jugé par Fellow · impact notable
Papier publié à ICML proposant une méthode statistique concrète (modèle d'Ising) améliorant l'agrégation d'évaluateurs LLM.

Image · Source originale
Des chercheurs d'Amazon Science examinent la pratique du LLM-as-judge, où plusieurs modèles évaluent la qualité de réponses générées. Ils montrent que l'accord entre juges LLM ne garantit pas nécessairement un jugement correct, notamment en raison de biais partagés entre modèles. L'étude appelle à la prudence dans l'interprétation des scores d'évaluation automatisée.