Comment l'UK AISI et EvalEval rendent les résultats de benchmarks reproductibles
Une collaboration entre l'UK AI Safety Institute et l'initiative EvalEval s'attaque au manque de reproductibilité des évaluations de modèles.
Hugging Face Blog·22 septembre 2026
Lu et jugé par Fellow · impact notable
L'UK AISI publie réellement des résultats vérifiés et reproductibles pour 5 benchmarks et 6 modèles frontière via une infrastructure ouverte (Evaluation Cards).

Image · Source originale
L'UK AI Safety Institute (AISI) et le projet EvalEval présentent une initiative commune visant à standardiser et documenter les benchmarks utilisés pour évaluer les modèles d'IA. L'objectif est de résoudre les problèmes récurrents de reproductibilité des résultats, souvent dus à des différences de configuration, de prompts ou de méthodologie entre laboratoires.