IdeaAMBIG : benchmark des écarts critiques d'implémentation dans les spécifications de recherche
IdeaAMBIG évalue la capacité des LLM à détecter et corriger les imprécisions méthodologiques entravant l'implémentation.
arXiv cs.AI · cs.LG · cs.CL·Yiling Ma, Yilun Zhao, Sihong Wu, Manasi Patwardhan·9 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark de recherche (660 instances) mesurant un goulot d'étranglement précis des LLM, mais portée limitée à un usage niche.

Image · Source originale
IdeaAMBIG est un benchmark de 660 instances évaluant la capacité des LLM à transformer des idées de recherche en code implémentable. Il évalue l'évaluation de la préparation à la codification, la localisation des défauts et la génération d'actions de clarification. Les résultats montrent que la localisation des défauts constitue le principal goulot d'étranglement pour les modèles actuels.