AI4AI-Bench : évaluer la capacité des agents LLM à concevoir des algorithmes d'entraînement
Nouveau benchmark testant si des agents LLM peuvent réécrire des algorithmes d'entraînement, condition clé pour une auto-amélioration récursive.
arXiv cs.AI · cs.LG · cs.CL·Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang·20 août 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark scientifique complet et vérifiable isolant une capacité critique pour l'avenir de l'IA.

Image · Source originale
AI4AI-Bench propose 10 dépôts de recherche figés couvrant 10 familles d'algorithmes d'entraînement. Un agent dispose de 4 heures sur un GPU B300 pour réécrire l'algorithme, qui est ensuite réexécuté et comparé à la version originale via un évaluateur caché. Sur 29 configurations testées, le score moyen atteint 0,166 et le meilleur système 0,250, loin de l'optimum théorique fixé à 1,0.